Anthropic 指控阿里「非法蒸馏」Claude 闹进参议院,同一天 Qwen 智能体论文登顶 HuggingFace;agent 研究密集轰炸
- 本期为历史回溯补档(归档日 2026-06-24,北京时间)。
- 实时社媒与算法推荐流无法回溯,且检索期间 WebSearch 接口不稳定,主线事实依据当日 CNBC 同日报道
本期速览
3 条01Anthropic 致信参议院
- 指控与阿里关联操作者用约 2.5 万欺诈账户、2880 万次交互「非法提取」Claude
02同一天 Qwen-AgentWorld 以 136 upvotes 登 HuggingFace 当日榜首,397B-A17B 档在自建 AgentWorldBench 上报 58.71、反超 GPT-5.4(58.25)与 Claude Opus 4.6(57.80)——但这是「模拟环境像不像真」的窄口径,非「做 agent 更强」
- 同一天 Qwen-AgentWorld 以 136 upvotes 登 HuggingFace 当日榜首
03PlanBench-XL 把前沿模型扔进 1665 个工具、平均 25 轮的长程规划
- GPT-5.4 无干扰 51.90%
本期编辑说明
本期为历史回溯补档(归档日 2026-06-24,北京时间)。由于实时社媒与算法推荐流无法回溯,且检索期间 WebSearch 接口不稳定,本期主线事实依据当日 CNBC 同日报道、HuggingFace 策展论文与可检索到的公开发布交叉整理,所有数字均可溯源至一手页面。
当天的硬新闻是 Anthropic 致信美国参议院银行委员会、指控与阿里关联操作者「非法提取」(蒸馏)Claude——这条以可独立核验的 CNBC 同日报道为准(Reuters 原文因反爬墙未能直接读取);戏剧性的是,指控见报同一天,阿里 Qwen 的智能体论文 Qwen-AgentWorld 登上 HuggingFace 当日榜首。除这条「IP 与中美 AI 竞争」主线外,当天 HuggingFace 被 agent 研究密集刷屏:长程规划评测、真实职场基准、经验学习、开源数据配方集体出现。实时社媒讨论因不可回溯未纳入,凡单方主张或自建基准的结论文中均已标注 caveat,特此说明。
本期导航
本期重点 · 深度报告
Key Numbers
Qwen-AgentWorld 当日票数
显著领先第二名(61 票);397B 档自建基准 58.71 反超 GPT-5.4 58.25
来源:HuggingFace Daily Papers 2026-06-24 →快讯 · 已核验与追踪
NatureBench:让 coding agent 去复现 Nature 论文的 SOTA,90 题里只过 17.8%
- Frontis.AI 提出跨学科基准 NatureBench,从同行评审的 Nature 系论文蒸馏出 90 个任务,配套 NatureGym 自动构建每题独立容器环境(解决此前『agent 做科研』基准的环境碎片化问题)。
- 在禁联网搜索的严格协议下评测 10 个前沿 agent 配置,最强者在 g>0.1 标准下仅超越 SOTA 17.8% 的任务。
要点拆解展开
为『AI for Science 里 agent 到底走到哪一步』提供了少见的、带严格协议(禁联网)和可复现环境的量化标尺。
- 对科研自动化的鼓吹者是一盆冷水:复现尚难、发明更远
- 对基准设计者,NatureGym 的容器化 + 维护方复现是值得借鉴的可信度方案。
- 这篇把『agent 能不能做科研』从口号拉回到可量化的冷数据:
- 17.8% 不是失败,而是诚实地标定了当前上限。
- 最有价值的是它对成功/失败路径的解剖——agent 主要靠『方法论翻译』(把科学问题塞进它熟悉的监督预测套路)取得进展,而非真正的科学发明
- 失败也多来自『选错方法』和『算力预算不足』,而不是『没读懂题』。
Grouped Query Experts:在注意力里做 MoE,KV cache 不变、只稀疏化查询头
- GQE 把 GQA 分组内的查询头当作专家,由路由器为每个 token 选 top-k 个查询头专家,而 KV 头保持稠密
- 始终计算,从而保留 GQA 的 KV cache 优势,只削减激活的查询头算力。
- 250M 参数 / 30B token 预算下,每 token 仅激活一半查询头,下游准确率仍与全激活 GQA 基线持平。
要点拆解展开
在长上下文推理成本高企的当下,任何『不增 KV cache 又能省算力』的结构都值得关注,且与现有 GQA 可叠加。
- 对训练/推理基础设施:提供一个与 GQA 兼容、可叠加的提速选项
- 但能否在主流尺寸保持『不掉点』需多种子、更大规模复现。
- 这是一条很『务实』的效率路线:不动 KV cache(推理显存的大头),只在注意力的查询侧做稀疏化,等于把 MoE 思路搬进 attention 而不破坏长上下文的内存画像。
- 但要诚实看待——这是『匹配而非提升』(激活减半
- 精度持平),且只验证到 250M/30B token 的小规模
- 小专家池,能否放大到主流尺寸仍是最大未知数。
MemGUI-Agent:把「管理上下文」做成一等动作,治长程手机 GUI agent 的健忘
- 针对 ReAct 式提示在长程手机 GUI 任务里被动堆历史
- 导致 prompt 爆炸又稀释关键跨 app 事实的问题,MemGUI-Agent 提出 Context-as-Action(ConAct):让同一个策略既选 UI 动作
- 也主动发出『折叠动作历史/折叠 UI 状态/保留近期步骤』三类结构化上下文管理动作。
- 配套 2956 条轨迹数据集 MemGUI-3K,训出的 8B 模型拿到 MemGUI-Bench 最佳开源数据成绩,并泛化到分布外的 MobileWorld。
要点拆解展开
把长程 agent 的上下文管理从被动累积改为可学习的一等动作,直击 prompt 爆炸与跨步骤事实丢失这一普遍失效模式。
- 对做 GUI/移动 agent 的团队:提供一套『上下文即动作』的可训练范式与开源数据
- 对长程 agent 研究,提示主动上下文压缩可能优于被动追加。
- 这条思路的聪明之处在于把『记什么、扔什么』从外挂的记忆模块变成策略自己学的动作
- 上下文管理和 UI 操作同源同策略,模型在『点哪个按钮』和『该记住哪个事实』之间统一决策。
- 它点中了长程 agent 的真实痛点:失败往往不是不会操作,而是走到第 30 步时忘了第 3 步填的关键信息。
- 8B 拿到最佳开源数据成绩 + 泛化到 OOD 基准,说明『主动压缩上下文』比『被动追加历史』更可学、更省 token。
EvoEmbedding:会随上下文「进化」的向量表征,为长上下文检索与 agent 记忆而生
- 现有 embedding 模型本质是静态的——孤立编码文本片段,忽略上下文和时序。
- EvoEmbedding 在顺序处理输入时维护一个持续更新的隐式记忆,与原始内容联合生成『可进化表征』:同一个查询会随上下文演化而检索到不同目标,超越静态语义搜索。
- 配套 EvoTrain-180K 数据集与防表征坍缩的记忆队列,在多个长上下文检索基准上超过 Qwen3-Embedding-8B
- KaLM-Embedding-Gemma3-12B 等更大模型。
要点拆解展开
把『上下文演化』引入 embedding,为长上下文检索与 agentic memory 提供了一条区别于静态语义搜索的新路线。
- 对 RAG / agent 记忆系统:提示检索相关性应随状态动态调整
- 以小搏大的结果说明动态表征的杠杆可能高于扩大模型规模。
- 这触及了 RAG 与 agent 记忆一个被默认忽略的假设:检索的『相关性』其实是随状态变化的。
- 同一句查询,在对话第 2 轮和第 20 轮该召回的东西可能完全不同——静态 embedding 做不到这点。
- EvoEmbedding 把『连续状态跟踪』塞进编码过程,让表征带上时序记忆,这对多轮 agent、个性化、长文档连续检索是结构性契合。
- 值得注意的是它用更小的模型反超 8B/12B 专家模型,说明『动态性』这个维度的收益可能比单纯堆参数更大。
KaLM-Reranker-V1:解耦 query 与 passage 计算的「快但非延迟交互」重排器
- 多数重排器把 query 与 passage 联合编码,计算紧耦合、部署不灵活。
- KaLM-Reranker-V1 提出『Fast but Not Late-interaction(FBNL)』:基于 encoder-decoder,用 encoder 配 Matryoshka 池化预先编码 passage,decoder 建模指令与查询意图,再用 cross-attention 捕捉相关性。
- 提供 Nano/Small/Large 三档(0.27B/1B/4B 激活参数),在 BEIR 上达 SOTA
- 与 Qwen3-Reranker 系列持平,同时效率更优。
要点拆解展开
在检索系统规模化的背景下,解耦 query/passage 计算同时保住相关性表达力,是重排器部署效率的实质改进。
- 对搜索/RAG 工程:提供可预编码 passage、在线只算轻量交互的重排方案,直接利好大规模低延迟检索
- Matryoshka 池化给出精度-延迟的可调旋钮。
- 重排器一直在两难之间:联合编码(cross-encoder)精度高但每次都要 query×passage 重算、无法预计算
- 延迟交互(late interaction,如 ColBERT)能预存 passage 但相关性建模较弱。
- KaLM 这条 FBNL 路线想两头通吃
- passage 侧可预编码缓存(像 late interaction),相关性又靠 cross-attention 保留表达力(像 cross-encoder)。
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
待验证|DataClaw0:把「数据处理」变成可学习的 agent 能力,从原始流裁剪多模态数据
- 清华等提出『Agentic Data Tailoring』:不再被动标注,而是主动把高熵的非结构化多模态流裁剪成与用户/下游意图对齐的结构化输出。
- 用『确定性事实锚点 + 生成式语义合成』两阶段流水线造数据,基于 9B 模型 SFT + GRPO 联合训练,并用下游后训练(视频生成、真实 VQA、GUI 导航)作为最终验证标尺,而非只看中间指标。
要点拆解展开
代表『数据处理即能力』的范式转向,并用下游任务闭环验证数据质量,与开源数据配方的趋势相互印证。
- 对数据团队与训练方:提供一条用 agent 自动裁剪、对齐多模态训练数据的路线,可能压缩数据准备成本
- 但合成质量与幻觉控制需第三方验证。
- 这反映了一个正在成形的判断:数据工程本身正在被『agent 化』。
- 把数据裁剪从一次性预处理变成可学习、可奖励优化的能力,意味着『为下游任务定制数据』可以闭环训练。
- 最聪明的是它的评测哲学
- 不自证『裁得好』,而是拿裁出来的数据去真正训下游模型(视频/VQA/GUI),用下游涨不涨分反向验证数据质量,这比任何中间指标都硬。