2026年6月23日 · 周二

智能体能力被「极限拷问」:长程规划与真实办公评测同日登场,效率派架构集体发力

  • 本期为历史回溯补档(归档日 2026-06-23,北京时间),实时社媒与算法流无法回溯,主要依据当日 HuggingFace 策展论文与可检索到的公开发布整理
  • 检索期间 WebSearch 接口持续不可用,深度选题以一手 arXiv/HuggingFace 论文为主力支撑,事实可溯源。

本期速览

3 条
  1. 01PlanBench-XL
    • 在 1665 个工具、平均 25 轮的任务上
  2. 02EnterpriseClawBench
    • 从 5291 条真实职场会话提炼出 852 个可复现任务
  3. 03效率派架构集体发力
    • GQE 在 GQA 上做专家路由

本期编辑说明

本期为历史回溯补档(归档日 2026-06-23,北京时间)。由于实时社媒与算法推荐流无法回溯,且检索期间 WebSearch 接口持续不可用,本期主力信源为当日 HuggingFace 策展论文与可检索到的公开发布,所有事实均可溯源至一手 arXiv / HuggingFace 页面。

当天没有头部厂商的重要模型发布,主线集中在「智能体到底行不行」的硬核评测,以及一批「省算力不掉点」的效率派架构/解码工作。实时社媒讨论因不可回溯未纳入,特此说明。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

6 篇

Key Numbers

PlanBench-XL 工具规模 / 平均轮次

327 个零售任务构成的长程规划评测,最长 100 轮、检索上限 30

来源:PlanBench-XL (arXiv 2606.22388)
1665 工具 / ~25 轮

EnterpriseClawBench 任务量 / 最佳成绩

自 5291 条真实职场会话提炼;最佳为 Codex+GPT-5.5,远未饱和

来源:EnterpriseClawBench (arXiv 2606.23654)
852 任务 / Lite 0.663

PerceptionDLM 并行感知吞吐

  • ParaDLC-Bench 准确率 62.4%(LLaDA-V 35.2%)
  • 单图延迟 10.04s→2.92s
来源:PerceptionDLM (arXiv 2606.19534)
最高 3.44×

Confident Decoding 额外开销 / 收益

训练免改、零额外 KV 显存;Qwen3.5-27B 在 LiveCodeBench v6 上 +10.1%

来源:Confident Layer Decoding (arXiv 2606.21906)
FLOPs <1% / LCB +10.1%
Briefs

快讯 · 已核验与追踪

5 条
产品上新重要度 3/5中置信官方源

MemSlides:分层记忆驱动的个性化幻灯片 agent,局部改稿不重生成整份

  • 当日 HF 策展 upvotes 最高(159)。
  • 北邮、清华等提出 MemSlides,把长期记忆(用户画像记忆+工具记忆)与工作记忆分离,做个性化幻灯片生成与多轮局部改稿:用『Plan–Act–Guard』流水线只改最小受影响区域,而非反复重生成整份 deck
  • 并放出 30 条人物-意图画像、覆盖 10 个职业的评测集。
要点拆解展开
Why

upvotes 最高,且代表多轮局部修订 + 偏好记忆这一 agent 产品化趋势。

Impact

对生产力工具开发者:提供了一套可借鉴的『记忆 + 局部编辑』架构,降低改稿成本、提升偏好一致性。

Numbers
HF upvotes
159当日策展最高;评测集 30 条人物-意图、10 个职业arXiv 2606.17162
早报判断
  • 它代表 agent 应用从『一次性生成』转向『可迭代、记得住偏好』的产品化方向。
  • 把『改一页不动全篇』做成一等公民,直击 PPT/文档类 agent 反复重生成、丢失上下文偏好的真实痛点。
  • 分层记忆 + 局部编辑这套组合,大概率会外溢到更广的文档/设计类 agent。
  • 值得关注的是其评测集偏小(30 条画像),普适性待更大规模验证。
接下来看
  • 分层记忆 + 局部编辑是否外溢到更广文档类 agent
  • 更大规模画像下的普适性
#Agent#记忆#幻灯片生成#个性化
研究论文重要度 3/5中置信官方源

DataClaw0:把『数据处理』变成可学习的 agent 能力,从原始流裁剪多模态数据

  • 清华等提出『Agentic Data Tailoring』:不再被动标注,而是主动把高熵的非结构化多模态流裁剪成与用户意图对齐的结构化输出。
  • 基于 Qwen3.5-9B,SFT + GRPO 联合训练,两阶段流水线(自底向上抽取『事实锚点』+ 自顶向下语义合成),分 Omni(统一)与 Expert(领域解耦)两种范式。
  • DataClaw0-val 上 Field 最高 97.53,接近 Gemini-3.1-Pro-Preview 的 98.12。
要点拆解展开
Why

代表『数据处理即能力』的范式转向,且用下游任务闭环验证数据质量。

Impact

对数据团队与训练方:提供了一条用 agent 自动裁剪、对齐多模态训练数据的路线,可能压缩数据准备成本。

Numbers
DataClaw0-E Field 分
97.53接近 Gemini-3.1-Pro-Preview 98.12;34K SFT 样本、8×A100arXiv 2606.21337
早报判断
  • 这反映了一个正在成形的判断:数据工程本身正在被『agent 化』。
  • 把数据裁剪从一次性预处理变成可学习、可奖励优化的能力,意味着『为下游任务定制数据』可以闭环训练。
  • 用下游后训练(GUI 导航、视频生成、时空 VQA)反向验证数据质量,是个聪明的评测设计。
  • 但 9B 模型在 Field 维接近顶级闭源、Semantic/Sequence 维仍有差距,说明结构对齐易、语义/序列建模难。
接下来看
  • 『数据处理即能力』能否成为主流训练范式
  • 语义/序列维度的差距能否补齐
#数据工程#多模态#Agent#GRPO
研究论文重要度 3/5中置信官方源

World Action Models 综述:给 WAM/VLA/世界模型『正名』,Dream Less, Act More

  • NUS 的综述试图终结社区对 World Action Models 的术语混乱:明确 WAM『不是带动作头的视频生成器』,提出『面向动作的未来』契约,给出两套分类(设计哲学视角:Render-and-Decode/Latent-Only/Video-Generation-Free
  • 组件解剖视角:预测基底/动作耦合/骨干/部署四轴),并把每个 WAM 表达为统一 4 元组,讨论可交互性、因果性、持久性、物理合理性、泛化五种具身属性。
要点拆解展开
Why

为混乱的 WAM/VLA/世界模型术语提供统一定义和分类,降低社区沟通成本。

Impact

对具身智能研究者:提供了清晰的分类框架与设计权衡地图;有助于厂商间口径对齐,减少概念营销。

Numbers
分类维度
3 设计哲学 / 4 组件轴5 种具身属性;统一 4 元组表达arXiv 2606.20781
早报判断
  • 在具身智能 + 世界模型概念被各家厂商反复包装的当下,一篇把术语和边界讲清楚的综述很有必要。
  • 它点出的趋势——『生成更少的未来
  • 只保留控制所需』——是对纯视频生成路线的纠偏:不必把整段未来渲染成像素,从潜空间/流/掩码直接解码动作可能更高效。
  • 对想入场具身的团队,这是一份难得的术语对齐与路线地图。
接下来看
  • 统一定义能否被社区采纳
  • 『生成更少未来』路线是否成为主流
研究论文重要度 2/5中置信官方源

OpenRath:把 agent 系统当运行时,提出以 Session 为核心的一等运行态

  • 清华的工作主张现代 agent 应用更像运行时系统而非简单对话,指出『隐藏运行态』问题——状态散落在日志、记忆库、trace 等旁路。
  • OpenRath 借鉴 PyTorch 编程模型:Session=流动的值,Agent=可复用变换(类比 layer),Workflow=组合容器,统一 forward(session)->session 契约,用 session.to(backend) 表达放置。
  • 定位为 AutoGen/LangGraph/OpenAI Agents SDK/MCP 的补充而非替代,且采用『审计优先』发布协议、不报跑分。
要点拆解展开
Why

切中 agent 工程化的真实痛点(运行态碎片化),提供了清晰的抽象与审计优先的工程范式。

Impact
  • 对 agent 框架开发者:提供了一套可借鉴的运行态抽象
  • 对从业者:提示『状态管理』是 agent 可靠性的核心。
Numbers
核心对象词汇
7 类Session/Sandbox/Tool/Agent/Memory/Workflow/Selector;不报跑分arXiv 2606.19409
早报判断
  • 这是 agent 工程化走向成熟的信号:当大家发现 agent 的真正难点是状态管理而非提示词时,把 Session 抽象成一等公民
  • 用熟悉的 PyTorch 心智模型组织 agent 程序,是个有工程品味的思路。
  • 不报跑分、只把声明映射到证据包的『审计优先』姿态也值得肯定——比起又一个刷榜框架,把运行态讲清楚更有长期价值。
  • 当然,能否被生态采纳取决于它与现有框架的互操作性。
接下来看
  • 与现有 agent 框架的互操作性
  • 审计优先发布协议能否被效仿
#Agent#运行时#框架#Session
研究论文重要度 2/5中置信官方源

CLI-Universe:为终端 agent 合成可验证任务,32B 模型 Terminal-Bench 2.0 冲到 33.4%

  • 南大、StepFun、上海 AI Lab 等针对终端 agent 训练数据稀缺,提出『由内向外』的任务合成引擎:任务蓝图构建→Docker 环境实体化→多阶段验证过滤(约三分之二候选被拒,仅 33.6% 存活)。
  • 产出 CLI-Universe-6K 训练集。
  • Terminal-Bench 2.0 上 CLI-Universe-32B 达 33.4%,超同尺寸 SkillSynth-32B(29.6)及更大的 Qwen3-Coder(480B,23.9),但仍落后 Claude-Opus-4.5(57.8)。
要点拆解展开
Why

终端 agent 训练数据稀缺,可验证合成是提升开源模型能力的关键路径。

Impact
  • 对开源 coding/终端 agent:提供了一条可复用的高质量数据合成路线
  • 但与顶级闭源的差距提醒不要高估纯数据合成的天花板。
Numbers
Terminal-Bench 2.0(32B)
33.4%基线 3.4→33.4;Claude-Opus-4.5 领先 57.8arXiv 2606.22883
早报判断
  • 终端/CLI agent 是 coding agent 的硬骨头,数据合成质量直接决定上限。
  • 这篇的价值在于把『可验证』做实——用角色分离的 agent 做规则门控测试、fail-to-pass 检查,官方解能通过 91% 合成测试。
  • 但也暴露了开源与闭源的鸿沟:32B 苦练到 33.4%,仍不及 Claude-Opus-4.5 的 57.8,说明高质量合成数据能缩小但远未填平差距。
接下来看
  • 能否持续推高 Terminal-Bench 2.0
  • 与顶级闭源模型的差距能否缩小
#终端agent#数据合成#coding#Benchmark
Developing

发展中 · 待进一步核验

1 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

研究论文重要度 2/5低置信官方源

待验证|BioMatrix:序列-结构-语言统一的生物基座,80 任务里 77 项 SOTA

  • 上海 AI Lab 等提出 BioMatrix,称是首个在单一 decoder-only 架构内原生融合『序列、结构、语言』、同时覆盖分子与蛋白质的多模态生物基座。
  • 通过统一 tokenization 把 SMILES/SELFIES、分子结构、蛋白序列/结构与语言映射到共享离散 token 空间,统一 next-token 预测,无需外部编码器或模态专用输出头。
  • 基于 Qwen3(1.7B/4B)持续预训练 3044 亿 token,在 6 类 80 个任务上 77 项达 SOTA 或有竞争力。
  • 提交者于 6 月 23 日提交。
要点拆解展开
Why

代表生物多模态统一基座的探索方向,且模型与数据集均开源。

Impact
  • 对 AI for Science 研究者:提供了一个统一架构的开源生物基座与 2360 万规模 SFT 数据集
  • 但跑分声明待第三方验证。
Numbers
SOTA 任务占比
77 / 806 类任务;基于 Qwen3 续训 3044 亿 tokenarXiv 2606.22138
早报判断
  • AI for Science 的一个值得记的方向:把生物多模态统一进一个『纯语言模型式』的 token 空间,省掉适配器和专用头,理论上能让分子与蛋白之间的跨模态生成更自然。
  • 77/80 SOTA 的说法很亮眼,但置信度需谨慎
  • 生物基座的评测口径差异大、复现门槛高,且『SOTA 或有竞争力』的措辞把两类结果混在一起。
  • 建议等第三方在标准任务上独立复现后再下定论。
接下来看
  • 77/80 SOTA 能否被第三方复现
  • 统一 token 空间对跨模态生成的实际增益