PlanBench-XL 工具规模 / 平均轮次
327 个零售任务构成的长程规划评测,最长 100 轮、检索上限 30
来源:PlanBench-XL (arXiv 2606.22388)本期为历史回溯补档(归档日 2026-06-23,北京时间)。由于实时社媒与算法推荐流无法回溯,且检索期间 WebSearch 接口持续不可用,本期主力信源为当日 HuggingFace 策展论文与可检索到的公开发布,所有事实均可溯源至一手 arXiv / HuggingFace 页面。
当天没有头部厂商的重要模型发布,主线集中在「智能体到底行不行」的硬核评测,以及一批「省算力不掉点」的效率派架构/解码工作。实时社媒讨论因不可回溯未纳入,特此说明。
327 个零售任务构成的长程规划评测,最长 100 轮、检索上限 30
来源:PlanBench-XL (arXiv 2606.22388)自 5291 条真实职场会话提炼;最佳为 Codex+GPT-5.5,远未饱和
来源:EnterpriseClawBench (arXiv 2606.23654)训练免改、零额外 KV 显存;Qwen3.5-27B 在 LiveCodeBench v6 上 +10.1%
来源:Confident Layer Decoding (arXiv 2606.21906)upvotes 最高,且代表多轮局部修订 + 偏好记忆这一 agent 产品化趋势。
对生产力工具开发者:提供了一套可借鉴的『记忆 + 局部编辑』架构,降低改稿成本、提升偏好一致性。
代表『数据处理即能力』的范式转向,且用下游任务闭环验证数据质量。
对数据团队与训练方:提供了一条用 agent 自动裁剪、对齐多模态训练数据的路线,可能压缩数据准备成本。
为混乱的 WAM/VLA/世界模型术语提供统一定义和分类,降低社区沟通成本。
对具身智能研究者:提供了清晰的分类框架与设计权衡地图;有助于厂商间口径对齐,减少概念营销。
切中 agent 工程化的真实痛点(运行态碎片化),提供了清晰的抽象与审计优先的工程范式。
终端 agent 训练数据稀缺,可验证合成是提升开源模型能力的关键路径。
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
代表生物多模态统一基座的探索方向,且模型与数据集均开源。