#具身智能
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 行业动态2026-08-23 · 周日重要度 3/5
人形机器人运动会开幕并扩至51项
第二届世界人形机器人运动会8月22日晚在北京开幕,报道称2056台机器人、666支队伍参加51个赛项。
- 这类赛事的产业价值来自公开任务集合,而不只是单次速度纪录。
- 全自主项目、场景赛和灵巧手赛项比百米成绩更能反映工程进展。
- 模型发布2026-07-31 · 周五重要度 5/5深度报告 →
Google 发布 Gemini Robotics 2 与 ER 2
Google DeepMind 发布 Gemini Robotics 2、On-Device 2 与 ER 2。三者分别覆盖云端全身控制、本地低延迟执行,以及持续数分钟、涉及数百次决策的任务编排与多机器人协作。
- Google 把感知、规划与动作拆成可组合层,而不是让单一模型包办全部机器人控制。
- 真实价值仍取决于跨硬件成功率和失败恢复数据。
- 研究评测2026-07-25 · 周六重要度 4/5深度报告 →
Drone-Bench 测模型编写无人机跟飞代码
Anthropic 与 Andon Labs 7 月 24 日公布 Drone-Bench,用 5 个独立软件子任务评估模型编写室内无人机定位、导航与跟飞代码的能力,共测试 15 个模型。
- 研究论文2026-07-09 · 周四重要度 4/5深度报告 →
RynnWorld-4D:阿里达摩院把视频世界模型推进机器人训练环境
HF Papers 收录 RynnWorld-4D 与 RynnWorld-Teleop。前者从单张 RGB-D 图和语言指令同步生成 RGB、深度、光流,后者用数字遥操作生成机器人训练视频。论文自报 Rynn4DDataset 1.0 达 2.544 亿帧,策略闭环约 9Hz,Teleop 单 H100 达 40 FPS。
- 研究论文2026-06-23 · 周二重要度 3/5
World Action Models 综述:给 WAM/VLA/世界模型『正名』,Dream Less, Act More
NUS 的综述试图终结社区对 World Action Models 的术语混乱:明确 WAM『不是带动作头的视频生成器』,提出『面向动作的未来』契约,给出两套分类(设计哲学视角:Render-and-Decode/Latent-Only/Video-Generation-Free;组件解剖视角:预测基底/动作耦合/骨干/部署四轴),并把每个 WAM 表达为统一 4 元组,讨论可交互性、因果性、持久性、物理合理性、泛化五种具身属性。
- 在具身智能 + 世界模型概念被各家厂商反复包装的当下,一篇把术语和边界讲清楚的综述很有必要。
- 它点出的趋势——『生成更少的未来
- 研究论文2026-06-22 · 周一重要度 3/5
WorldLines:长程具身智能体的状态化记忆基准与 ObsMem 框架
WorldLines(arXiv 2606.18847,HKUST(GZ)/HKUST/Knowin)面向长程家庭具身助理,构造时间跨度长的家庭轨迹(对话、动作、反馈、状态变化),拆为记忆 QA 与具身任务规划两类样本;提出观察者锚定的记忆框架 ObsMem,用事件/状态/信念/承诺四类记忆轨道并区分『观察到』与『被告知』来源。在记忆 QA 上 Judge 0.713、完美率 69%,各维度领先 A-mem/Mem0。
- WorldLines 把『智能体记忆』从纯文本 QA 拉进了部分可观测的物理环境
- 这才是家庭/服务机器人真正面对的难题:世界状态在变、信息有真假来源、旧记忆会过期。