#Benchmark
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 安全治理2026-08-26 · 周三重要度 5/5深度报告 →
Anthropic设500万美元资助AI幸福感评测
Anthropic 8月25日启动500万美元资助计划,支持独立团队构建开源评测来衡量AI对用户wellbeing的影响。
- Anthropic把安全问题从单轮回答正确性推进到长期对话影响。
- 它没有宣称已解决陪伴和心理危机场景,只是在补独立评测能力。
- 研究论文2026-08-25 · 周二重要度 3/5
8月24日跟进|OmniAssistBench登HF日榜
Hugging Face 8月24日把OmniAssistBench列入Daily Papers;论文8月21日提交,目标是评测实时视频助手的多轮交互能力。
- 新闻点是社区策展和项目页更新,论文首发日期仍是8月21日。
- 它值得保留,因为指标从被动视频理解转向模型建议会改变用户后续动作的交互场景。
- 研究论文2026-08-19 · 周三重要度 2/5
IBM称Agent记忆需要按模型能力配剂量
IBM Research在8月18日于Hugging Face发布博客,称评测8个模型后发现,Agentic memory不是越多越好,而应按模型能力校准。
- 这条适合作为agent工程方法信号:经验蒸馏和检索注入并不天然提升所有模型。
- 它提醒团队把记忆当作可调参数,而不是把历史上下文无限塞进prompt。
- 模型发布2026-08-13 · 周四重要度 3/5深度报告 →
DeepSeek V4 Pro API切至0813,变更日志缺席
DeepSeek官方API别名已映射到DeepSeek-V4-Pro-0813,价格页显示当前规格与单价;0813专属能力变更日志与官方新benchmark仍未发布。
- 此条价值在于版本映射与价格可见性,而非已证实的能力升级。
- 调用方应记录版本并回归测试
- 研究论文2026-08-13 · 周四重要度 4/5深度报告 →
8月12日解读|Google称事实召回成为瓶颈
Google Research于8月12日发布对2月论文的新解读。研究用2150个事实、13个模型和约450万次回答区分编码与召回,称GPT-5与Gemini-3 Pro已编码95%至98%的事实,但直接召回仍失败26%至34%。
- 该研究把部分幻觉问题从模型没学到改写为模型取不出来,支持按需推理与召回增强。
- WikiProfile来自Wikipedia事实且依赖自动评分,尚不能取代开放域和业务事实性评估。
- 模型发布2026-08-13 · 周四重要度 5/5深度报告 →
Qwen首次开放Max级权重,2.4T模型进入可下载阶段
Qwen于8月12日开放Qwen3.8-2.4T-A95B权重与配置。模型卡列出2.4T总参数、95B激活参数和262,144 token原生上下文;仓库制品达4.89 TB。
- 开放Max级权重把前沿能力的可审计性和部署主权向研究机构与大型算力持有者推进了一步。
- 2.4T规模意味着许可和集群成本决定实际开放程度。
- 模型发布2026-08-13 · 周四重要度 5/5深度报告 →
xAI发布Grok 4.6,主攻长时智能体任务
xAI于8月12日发布Grok 4.6,重点从单轮能力推进到多步骤研究、代码库操作和视觉制品。第三方Artificial Analysis给出61分,与GPT-5.6 Sol同分;同分只限其九项综合指数。
- xAI把升级重点从单轮回答移到持续执行和可交付制品。
- 第三方指数提供了横向参照,但厂商与评测机构的结果仍需要真实长程任务复现。
- 研究论文2026-08-12 · 周三重要度 4/5
Google让AMIE进入实时视频会诊模拟
Google Research于8月11日披露AMIE实时视频会诊研究。在100个模拟病例中,30名初级保健医生与15名标准化患者演员参与比较;团队称视频版AMIE在多项会诊质量指标上优于文字版,但尚未用于真实临床。
- 从文字问诊进入同步视频,使模型面对语速、表情和检查指导等更真实的沟通变量。
- 模拟OSCE可以验证交互能力,却不能替代真实患者安全、偏差和临床结果评估。
- 模型发布2026-08-11 · 周二重要度 4/5深度报告 →
Meta开放30B参数Muse Glimmer本地智能体模型
Meta于8月10日开放Muse Glimmer权重。这是一款约30B参数、Apache 2.0许可的多模态智能体模型;官方称4-bit文本权重低于20GB,但完整本地部署与厂商跑分仍待独立复现。
- Muse Glimmer把本地模型的目标从离线聊天推进到持续工具调用与任务恢复。
- 开放许可和消费硬件适配降低部署门槛,但量化后的长上下文可靠性、工具成功率与能耗才决定其实际价值。
- 产品上新2026-08-06 · 周四重要度 3/5深度报告 →
Prime Intellect发布自我改进编码harness
Prime Intellect于8月5日发布开源Prime Agent,称其以递归语言模型和持续harness为核心,让编码智能体利用执行结果、日志与失败原因改进后续任务表现。
- 这类项目把“会写代码”的模型能力移到一个持续收集轨迹、评估和再利用经验的运行框架中。
- 其ARC-AGI-3数字来自项目方,新闻价值在开源harness的设计与可检验性,而不是把单次评测写成通用智能结论。
- 研究评测2026-07-28 · 周二重要度 4/5深度报告 →
Kimi发布PerceptionBench,榜首准确率59.7%
Kimi发布PerceptionBench并开放代码与数据入口,从42个基准的失败中归纳10类原子视觉能力,构造3000道题。代码仓库为Apache-2.0,数据卡标记CC BY-NC 4.0。
- 它试图把“看错”与“推理错”拆开,避免知识和推理掩盖感知短板。
- 榜单由发布团队自建,题目筛选与泄漏风险仍需第三方检查。
- 工程基准2026-07-26 · 周日重要度 2/5
LoRA Speedrun 项目登记 43.9 秒单卡纪录
LoRA Speedrun 项目 7 月 25 日登记 Track 1 第四项纪录:单张 L40S 上把 Qwen2.5-1.5B 微调至 GSM8K 至少 57%,三次训练均值为 43.9 秒。
- 这项项目自有验证的价值在于固定硬件、模型、任务和质量门槛后比较优化方法。
- 项目外团队尚未公开复跑,数字也不能外推为任意 LoRA 训练只需几十秒。
- 研究论文2026-07-14 · 周二重要度 4/5深度报告 →
LHTB 上榜 HF Daily:长程终端 Agent 仍吃力
Long-Horizon Terminal-Bench 7 月 13 日进入 HF Daily Papers。项目页用 46 个任务和 90 分钟预算展示 18 模型榜单,arXiv 摘要则是 15 模型实验口径。
- 它把 Agent 评测从“最后是否通过”推进到“中途走到哪里”。
- 项目页与 arXiv 摘要的模型数口径不同,深读时必须分开引用。
- 模型动态2026-07-13 · 周一重要度 1/5
待验证|Grok 4.5 浏览器表现说法缺少公开评测
Elon Musk 在 X 称 Grok 4.5 的浏览器使用能力达到 Opus 级别。该说法引用单个评测账号,尚无官方 benchmark 或可复现报告。
浏览器任务值得跟踪,但单条 X 评价不能给模型定级。需要公开任务集、成本口径和失败轨迹才能比较。
- 研究论文2026-07-11 · 周六重要度 4/5深度报告 →
待验证|IdeaGene-Bench:AI 科研助手开始考研究谱系
IdeaGene-Bench 提出科研想法谱系评测。当前证据集中在论文、arXiv 与 HF 页面,少源且未复现,结论需低置信处理。
- 科研 Agent 的评测正在从生成新点子转向理解思想继承。
- 由于证据仍集中在论文和分发页,今天只能把它作为低置信候选记录。
- 研究论文2026-07-11 · 周六重要度 4/5深度报告 →
待验证|UniClawBench:400 个真实任务把 Agent 评测推向闭环执行
UniClawBench 进入 Hugging Face Papers,提出 400 个双语真实任务;当前结果仍主要来自作者论文和项目数据。
- Agent 评测正在从静态答题转向可执行环境。
- 真正重要的是它把失败原因拆成技能使用、探索、长上下文、多模态和跨平台协同五类能力。
- 研究论文2026-07-01 · 周三重要度 5/5深度报告 →
OpenAI 推 GeneBench-Pro:129 道合成题把研究级智能体评估从『答题』推向『研究决策』,GPT-5.6 Sol 高档仅 28.7%
OpenAI 发布研究级基准 GeneBench-Pro,把 AI 智能体在计算生物学中的评估从『答得对』推向『能否独立做出研究级判断』,覆盖统计遗传学/群体遗传学/定量遗传学/调控组学/功能基因组学/蛋白质组学/临床-PGx-诊断/癌症基因组学/微生物基因组学/法医遗传学共 10 大域、21 个子域、129 道合成题——每道题都用已知因果结构的合成数据集,可直接模拟、绕开作者偏好。所有题经外部专家审核,UCLA Alexander Strudwick Young 给出的评价是『对没有资深导师反复指导的研究生来说都很难』。GPT-5.6 Sol 在最高推理档通过率 28.7%(Pro 模式 31.5%),最低档个位数;解题数约为 GPT-5.2 的 6 倍,token 消耗只有 2/3。GPT 与开源模型(GLM 5.2 等)的科研推理差距显著大于代码差距——说明开源更偏代码。人类专家估时 20-40 小时/题、$200/h 即数千美元,而推理成本仅几美元/题。10 题已开源至 Hugging Face,50 题将给 Artificial Analysis;OpenAI 预判年底该基准会被刷满。
- 头条2026-06-30 · 周二重要度 5/5深度报告 →
Cognition 发布 Devin Fusion:混合模型 harness,把『Fable 级智能』的成本压低 35%,把『能跑 benchmark』与『能写生产代码』两条曲线明确分开
Cognition AI 于 2026-06-29 通过官方 X 账号推出 Devin Fusion——一种新型混合模型 harness,专门解决『传统 routing 能过 benchmark 却写不出能合并的代码』的痛点。Cognition 自报,在内部测试中 Devin Fusion 把达到 Fable 级智能的成本压低了约 35%,且产出的代码质量仍是『你想 merge 的那种』。Cognition 借此把『能跑 benchmark 的模型』与『能写生产代码的模型』明确分开——这是 agent 工程化中『benchmark 与生产之间的距离』这一核心问题的正面回应。
- 行业动态2026-06-28 · 周日重要度 2/5
待验证|awesome-evals 等开源资源升温:Agent 评测正从『刷榜』走向工程化基础设施
本周 GitHub 多个 agent 工具/资源升温:benchflow-ai/awesome-evals(544★,Agent 评测论文/工具/基准精选库)、eli-labz/Godcoder(245★,本地优先开源编码 agent,代码不离机)、NotASithLord/peerd(202★,首个浏览器原生 agent harness)、lightbearco/tupper(128★,本机安全运行不可信 AI 生成代码的沙箱)。另有 @omarsar0 推荐的 LLM-as-judge 论文 BINEVAL(842 赞):把评估标准拆成原子化是/否问题逐题独立判断再聚合,可精确诊断输出为何低分,在 SummEval/QAGS 等无需训练即匹敌或超过 G-Eval。
- 把这几个项目放在一起看,一条清晰的趋势浮现:agent 评测与运行环境正在从『跑个 benchmark 报个分』变成一类正经的工程基础设施。
- awesome-evals 这种精选库的走红,说明社区开始系统性沉淀『怎么评测 agent』的知识
- 研究论文2026-06-27 · 周六
BINEVAL:把 LLM-as-judge 拆成原子级是非题,可定位低分原因
BINEVAL 提出将评估维度拆成原子级是非题、对每个输出独立作答再聚合为校准的多维分数,每个问题级判定可检查、能精确定位输出为何低分并作为改进 prompt 的信号;在 SummEval、Topical-Chat、QAGS 上匹配或超过 UniEval 和 G-Eval,免训练、事实一致性表现尤佳。
- 整体打分会掩盖推理过程和天花板效应,这是 LLM-as-judge 被诟病的主因
- BINEVAL 的"原子是非题+可追溯"把不可解释的总分变成可调试的信号,直接对接 prompt 迭代。
- 观点观察2026-06-27 · 周六
Agent Arena Token 效率:Fable 质量最高,GPT-5.5 最省,Grok 烧 token 倒退
Code Arena 母榜发布 Agent Arena Token 效率分析(模型在搜索/文件系统/终端工具下完成真实任务),Fable 质量最高(+14.1%),优于同 token 用量的 Opus 4.8 Thinking(+9.2%);三个 GPT-5.5 变体均在效率前沿之上(+6.2% 至 +8.6%)且用量更少;GLM-5.2 达 +5.1% 接近趋势线。Gemini-3.5 Flash 耗 token 最多却远低于前沿,Grok Build 0.1 烧 20K+ token 反而净负增长。
- 'Token≠收益'是这组数据最该被记住的结论:烧 token 的模型未必更强,甚至可能越用越差。
- 对 agent 选型而言,每美元有效产出正在取代裸能力分成为更现实的采购指标
- 研究论文2026-06-27 · 周六
MoA 混合代理:NousResearch 称超闭源,论文发现'共败上限'
NousResearch 将 Hermes Agent 的 MoA(混合代理)预设作为虚拟模型开放,自称在即将发布的基准上比 Opus 4.8 高 8%、比 GPT-5.5 高 11%;同期 arXiv 论文《When Does Combining Language Models Help?》跨 67 个前沿模型发现路由/投票/MoA 存在"共败上限",组合收益受限于成员模型共同失败的模式。
- 两条消息正好构成一组张力:NousResearch 证明开源靠"组合"能逼近甚至超过单点闭源,但论文警告组合的天花板由成员模型的共同盲区决定
- 越同质的模型群组合收益越小。
- 研究论文2026-06-26 · 周五深度报告 →
MirrorCode 基准:Opus 4.7 仅凭运行行为重写软件,14 小时抵人类数周
Epoch AI 等机构的 MirrorCode 基准要求 AI 仅凭程序可执行行为(可运行但无源码)重写整套软件,覆盖 25 个目标程序、6 种语言(Python/C/Rust/Go/OCaml/Ada),用含隐藏测试的端到端测试判定一致性。最强模型 Claude Opus 4.7 全基准 56%(8 个月前模型约 30%);典型案例重写 1.6 万行 Go 生物信息学工具包 gotree(40+ 命令),用 14 小时通过 2000/2001 测试(99.95%)、花费 $251,人类估计需 2-17 周,单个大任务一次尝试可耗 $2600/19 天。Mollick 借此称"聊天机器人时代已结束"。
- 研究论文2026-06-24 · 周三重要度 3/5
NatureBench:让 coding agent 去复现 Nature 论文的 SOTA,90 题里只过 17.8%
Frontis.AI 提出跨学科基准 NatureBench,从同行评审的 Nature 系论文蒸馏出 90 个任务,配套 NatureGym 自动构建每题独立容器环境(解决此前『agent 做科研』基准的环境碎片化问题)。在禁联网搜索的严格协议下评测 10 个前沿 agent 配置,最强者在 g>0.1 标准下仅超越 SOTA 17.8% 的任务。
- 这篇把『agent 能不能做科研』从口号拉回到可量化的冷数据:
- 17.8% 不是失败,而是诚实地标定了当前上限。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
EnterpriseClawBench:用真实职场会话造基准,最强 agent 也只过 0.766
一个从专有真实 agent 会话蒸馏出的企业级基准:5291 条原始任务实例经自动化流水线收敛成 852 个可复现任务。全集最强 GPT-5.5 仅 0.766,Lite 子集顶分只有 0.663,远未饱和。核心发现是 agent 表现高度依赖 harness 而非只看模型——Claude 系在 Hermes 运行时从 0.62-0.64 骤降到 0.458。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
PlanBench-XL:1665 个工具的长程规划评测,前沿模型在「静默失败」前集体失灵
UIUC 团队提出交互式长程规划基准 PlanBench-XL:327 个零售任务、1665 个工具、56 种数据类型,工具需检索动态发现,平均约 25 轮、最短解 5–9 次调用。Gemini-3.1-Pro 最强(77.06%),GPT-5.4 默认 51.90% 但在最严重阻塞下崩到 11.36%,最小模型为 0%;探索度与准确率强相关(r=0.902),「静默失败」危害最大。
- 研究论文2026-06-23 · 周二重要度 2/5
CLI-Universe:为终端 agent 合成可验证任务,32B 模型 Terminal-Bench 2.0 冲到 33.4%
南大、StepFun、上海 AI Lab 等针对终端 agent 训练数据稀缺,提出『由内向外』的任务合成引擎:任务蓝图构建→Docker 环境实体化→多阶段验证过滤(约三分之二候选被拒,仅 33.6% 存活)。产出 CLI-Universe-6K 训练集。Terminal-Bench 2.0 上 CLI-Universe-32B 达 33.4%,超同尺寸 SkillSynth-32B(29.6)及更大的 Qwen3-Coder(480B,23.9),但仍落后 Claude-Opus-4.5(57.8)。
- 终端/CLI agent 是 coding agent 的硬骨头,数据合成质量直接决定上限。
- 这篇的价值在于把『可验证』做实——用角色分离的 agent 做规则门控测试、fail-to-pass 检查,官方解能通过 91% 合成测试。
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
EnterpriseClawBench:把 5291 条真实职场会话变成评测,给 Claude Code、Codex 直接打分
Frontis.AI 从真实企业 agent 会话中提炼出 852 个可复现任务(含 120 题人工审核 Lite 子集),用『硬规则 + 五维语义评判』双层打分,评测 32 个 harness-模型组合。最佳 Lite 仅 0.663(Codex+GPT-5.5);全集 DeepAgents 上 GPT-5.5=0.766、Sonnet 4.6=0.749、Haiku 4.5=0.632。因含内部内容数据不公开,公开的是构建与评测协议。
- 它补上了 agent 评测最稀缺的一环:真实办公场景而非合成任务。
- 两个判断值得划重点:其一,harness 影响巨大
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
PlanBench-XL:把前沿模型扔进 1665 个工具的「迷宫」,长程规划集体露怯
UIUC 团队提出 PlanBench-XL,用 327 个零售任务、1665 个需检索发现的工具、平均约 25 轮交互,评测 LLM 智能体在大规模工具生态下的长程规划。引入显性/隐性/误导三类工具阻塞模拟「缺失、失效、干扰」。GPT-5.4 无干扰准确率 51.90%,重度阻塞下骤降至 11.36%;Gemini-3.1-Pro 以 77.06% 领先,Qwen3-8B、Llama-3.1-8B-Instruct 为 0%。
- 这是当天最有分量的一篇:它把「agent 能不能用」的问题从单步工具调用提升到大规模工具生态 + 动态故障的真实复杂度。
- 最扎心的发现是『沉默失败最伤』
- 研究论文2026-06-22 · 周一重要度 4/5深度报告 →
GateMem:首个『记忆治理』基准,现有方法全部不及格
GateMem 把记忆智能体从单用户假设推向医院/职场/校园/家庭等多主体共享场景,联合考核有用性、跨授权边界的访问控制、删除后的主动遗忘三件事。基准含 91 段多方长对话、2218 个隐藏检查点、4 个域、7 个记忆基线 × 6 个底座 LLM。结论:没有任何方法能同时做到强可用、稳健访问控制与可靠遗忘。