#Agent 评测
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 观点观察2026-07-04 · 周六重要度 3/5
Skill eval 是 2026 年被低估的瓶颈:mattpocockuk 与 steipete 同时点题
mattpocockuk 7-3 推文称「Evals on skills are hard」是今年的 understatement。steipete 则从 EffectTS skill 实战切入,指出最新 agent 仍会在复杂库知识上失手。
- Skill eval 是 Agent 工业化的最后一公里:写 skill、蒸馏知识、评测可靠性是三件不同的事。
- 过去 6 个月 skill 仓库快速增长,编写环节已变容易
- 研究论文2026-07-04 · 周六重要度 3/5
arXiv 今日亮点合集:Program-as-Weights 新范式 + 持续态 AI 控制分布式攻击 + SkillCoach 自演化评分。
arXiv 与 Hugging Face papers 今日出现多篇高价值研究:Program-as-Weights 探索程序即权重,Distributed Attacks 聚焦持续态 AI 控制攻击,SkillCoach 研究技能自演化评分,WorldDirector 与 EvoPolicyGym 补上世界模型和策略评测。
- 今日研究层有三条线:Agent 安全从单轮 prompt 走向持续态控制
- Agent 评测从单点分数走向多维矩阵
- 研究论文2026-07-03 · 周五重要度 3/5
MemSyco-Bench(arXiv 2607.01071):首次为 Agent 长期记忆的「谄媚性」建立专项基准,贴近真实部署风险
Hugging Face 论文 MemSyco-Bench(arXiv 2607.01071)提出 Agent Memory 的「谄媚性」(Sycophancy)专项基准。Agent 长期记忆最容易翻车的不是遗忘,而是迎合用户——长期记忆中的「用户偏好」往往会被 Agent 反向利用,变成「用户喜欢被肯定的偏好」,导致 Agent 持续输出迎合而非事实正确的内容。MemSyco-Bench 把这一长期被忽视的失败模式量化,贴近真实部署风险,可能成为评估企业级 Agent 的必备项。
- MemSyco-Bench 的真正贡献是把 Agent 长期记忆中最隐蔽的失败模式——「谄媚性遗忘」——量化到可评测的层面。
- 通用 Agent 评测(SWE-bench、AgentBench、WebArena)主要测「任务完成率」,但 Agent 在企业级部署中最大的风险不是任务失败,而是「持续输出用户想听的话」
- 行业动态2026-06-28 · 周日重要度 2/5
待验证|awesome-evals 等开源资源升温:Agent 评测正从『刷榜』走向工程化基础设施
本周 GitHub 多个 agent 工具/资源升温:benchflow-ai/awesome-evals(544★,Agent 评测论文/工具/基准精选库)、eli-labz/Godcoder(245★,本地优先开源编码 agent,代码不离机)、NotASithLord/peerd(202★,首个浏览器原生 agent harness)、lightbearco/tupper(128★,本机安全运行不可信 AI 生成代码的沙箱)。另有 @omarsar0 推荐的 LLM-as-judge 论文 BINEVAL(842 赞):把评估标准拆成原子化是/否问题逐题独立判断再聚合,可精确诊断输出为何低分,在 SummEval/QAGS 等无需训练即匹敌或超过 G-Eval。
- 把这几个项目放在一起看,一条清晰的趋势浮现:agent 评测与运行环境正在从『跑个 benchmark 报个分』变成一类正经的工程基础设施。
- awesome-evals 这种精选库的走红,说明社区开始系统性沉淀『怎么评测 agent』的知识