#世界模型
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-07 · 周五重要度 3/5
官方单源|NVIDIA介绍Cosmos 3世界模型家族
官方单源|NVIDIA于8月6日发布Cosmos 3说明,列出64B Super、16B Nano与4B Edge三档开放模型,并称其覆盖视觉推理、世界生成与动作预测。
- 官方单源可确认家族分层、许可证和应用路径。
- 多项第一名均为厂商引用的榜单时点,不能外推为机器人或自动驾驶系统的端到端安全表现。
- 研究论文2026-07-09 · 周四重要度 4/5深度报告 →
RynnWorld-4D:阿里达摩院把视频世界模型推进机器人训练环境
HF Papers 收录 RynnWorld-4D 与 RynnWorld-Teleop。前者从单张 RGB-D 图和语言指令同步生成 RGB、深度、光流,后者用数字遥操作生成机器人训练视频。论文自报 Rynn4DDataset 1.0 达 2.544 亿帧,策略闭环约 9Hz,Teleop 单 H100 达 40 FPS。
- 研究论文2026-06-28 · 周日重要度 2/5
论文:世界模型的幻觉是可预测、可预防的
一篇 arXiv 论文(Hallucination in World Models is Predictable and Preventable)研究世界模型(用于 agent 规划/仿真的环境预测模型)中的幻觉问题,主张这类幻觉并非随机不可控,而是可预测、可预防的,并给出相应的识别与抑制方法。
- 这条接在 Qwen-AgentWorld 等『把世界模型当 agent 训练第一性目标』的热潮之后,问到了点子上:如果要用世界模型做可控模拟器来替代真实环境训练 agent,那模拟器自己会不会『幻觉』出不存在的状态转移,就是整条路线成立与否的关键约束。
- 如果幻觉真的可预测、可预防,意味着世界模型作为 RL 训练环境的可靠性有了工程抓手
- 模型发布2026-06-26 · 周五深度报告 →
Qwen-AgentWorld:用「语言世界模型」当 agent 的训练场,但「超 Opus 4.8」要拆开看
通义千问开源原生语言世界模型 Qwen-AgentWorld,用单一模型模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,把「环境建模」当成从预训练第一天起的目标。开源 35B 总参/3B 激活的 MoE(256K 上下文)与 AgentWorldBench。核查后:真正超过 Opus 4.8 与 GPT-5.4 的是未明确开源的 397B 旗舰(58.71),开源的 35B(56.39)仅与 Opus 4.8 持平偏下;但「世界模型预热」对 7 项外部 agent 基准的零样本迁移增益(WideSearch +12.8、Claw-Eval +11.3)是更扎实的看点。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
Qwen-AgentWorld:把「环境建模」做成第一性训练目标的语言世界模型
阿里通义千问发布 Qwen-AgentWorld,用单一语言模型通过长思维链模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,开源 35B-A3B 与 397B-A17B 两档,基于超 1000 万条交互轨迹三阶段训练。提出「先预测环境、再行动」范式,既可作可控模拟器替代真实环境做 RL(增益超过真实环境训练),也可作预热阶段提升 7 项 agent 基准。当日 HuggingFace 最高票 136 upvotes。
- 研究论文2026-06-23 · 周二重要度 3/5
World Action Models 综述:给 WAM/VLA/世界模型『正名』,Dream Less, Act More
NUS 的综述试图终结社区对 World Action Models 的术语混乱:明确 WAM『不是带动作头的视频生成器』,提出『面向动作的未来』契约,给出两套分类(设计哲学视角:Render-and-Decode/Latent-Only/Video-Generation-Free;组件解剖视角:预测基底/动作耦合/骨干/部署四轴),并把每个 WAM 表达为统一 4 元组,讨论可交互性、因果性、持久性、物理合理性、泛化五种具身属性。
- 在具身智能 + 世界模型概念被各家厂商反复包装的当下,一篇把术语和边界讲清楚的综述很有必要。
- 它点出的趋势——『生成更少的未来