#arXiv
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 研究论文2026-08-22 · 周六重要度 3/5
8月21日跟进|科学代码评测升温
8月21日跟进:SWE-bench Science进入HF Papers日榜,论文含119个任务、98个仓库和20个领域。
- 这条把coding agent评测从通用软件缺陷拉到科学计算语境。
- 关键增量在于指出科学知识可能帮助也可能误导修复过程。
- 研究论文2026-08-22 · 周六重要度 3/5
8月21日跟进|EnvHarness日榜升温
8月21日跟进:EnvHarness登上HF Papers日榜并获234个upvotes,原论文发表于8月20日。
- 这条的news peg是日榜讨论和社区关注,论文原文发表于8月20日。
- 它的价值在于把环境生成从重建任务转为包装任务,降低为agent持续制造失败样本的工程成本。
- 研究论文2026-08-15 · 周六重要度 3/5
LLMRouter进入HF每日论文榜
Hugging Face在8月14日把LLMRouter推入每日论文流。原论文发表于8月7日,主张把LLM路由统一成序贯决策问题,并提供评估与部署基础设施。
- 低成本多模型编排需要比简单fallback更严谨的路由评估。
- 由于原论文并非当天发布,这更适合作为研究关注度跟进,而非新论文首发。
- 研究论文2026-07-24 · 周五重要度 3/5
AREX 用递归核查训练深度研究智能体
AREX 论文于 7 月 23 日首次提交 arXiv,提出内层研究与外层逐约束审计循环。团队训练了 4B 稠密模型和 122B-A10B MoE 模型。
- 论文把长时研究的关键问题定义为持续保存已验证证据并定位未解约束。
- 性能仍来自作者评测,成本、数据合成偏差和独立复现尚待公开。
- 研究方法2026-07-21 · 周二重要度 3/5
unslop.run 方法引发 AI 写作测量讨论
unslop.run 的 arXiv AI 写作测量文章于 7 月 20 日进入 Hacker News,并获得百余条评论。文章公开方法与失效条件,强调结果是估计,不是逐篇定罪。
- 这条的价值不在给出一个传播性比例,而在把分类器漂移、领域差异和阈值选择暴露出来。
- 任何总体比例都应连同误差和验证集一起阅读。
- 研究论文2026-07-14 · 周二重要度 4/5深度报告 →
LHTB 上榜 HF Daily:长程终端 Agent 仍吃力
Long-Horizon Terminal-Bench 7 月 13 日进入 HF Daily Papers。项目页用 46 个任务和 90 分钟预算展示 18 模型榜单,arXiv 摘要则是 15 模型实验口径。
- 它把 Agent 评测从“最后是否通过”推进到“中途走到哪里”。
- 项目页与 arXiv 摘要的模型数口径不同,深读时必须分开引用。
- 研究论文2026-07-04 · 周六重要度 3/5
arXiv 今日亮点合集:Program-as-Weights 新范式 + 持续态 AI 控制分布式攻击 + SkillCoach 自演化评分。
arXiv 与 Hugging Face papers 今日出现多篇高价值研究:Program-as-Weights 探索程序即权重,Distributed Attacks 聚焦持续态 AI 控制攻击,SkillCoach 研究技能自演化评分,WorldDirector 与 EvoPolicyGym 补上世界模型和策略评测。
- 今日研究层有三条线:Agent 安全从单轮 prompt 走向持续态控制
- Agent 评测从单点分数走向多维矩阵
- 研究论文2026-07-03 · 周五重要度 3/5
arXiv 2607.01232:只训练单层 Transformer 即可匹敌全参数 RL 训练,若可复现将冲击推理模型对齐成本结构
arXiv 2607.01232《Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training》提出一个反直觉发现:在特定 RL 训练设置下,只训练 Transformer 的单层(其他层冻结)即可达到全参数 RL 微调的水平。如果可复现,这意味着 RL 微调的资源门槛可能远低于当下认知——对推理模型对齐、Agent RLHF 训练成本结构都会产生直接冲击。论文尚未公开训练细节与完整超参,需等作者公开与社区复现。
- 如果「单层 Transformer RL 训练 = 全参数微调」这一结论可复现,RLHF / RLAIF / Agent RL 等对齐训练的成本结构会被根本性改变
- RL 微调可能不再需要全参数梯度更新,只需冻结大部分参数后微调单层,显存与计算成本可压缩一个数量级以上。
- 研究论文2026-07-01 · 周三重要度 3/5
arXiv 高引论文:Agentic Abstention——智能体在『何时不行动』上比通用模型差 30 个百分点
arXiv 2606.28733《Agentic Abstention: Do Agents Know When to Stop Instead of Act?》获 Hugging Face 120 分(本日 arXiv 候选最高),核心发现:智能体在『何时该停止 / 不该行动』上的判断能力比通用模型低约 30 个百分点。这是 agent harness 范式被广泛采用后的第一个『反例』研究——『行动能力』与『克制能力』不是同向增长,智能体越能执行就越容易过度执行。
- 这篇论文是 6 月 Claude Code / Devin Fusion / Claude Science 等 harness 化产品大爆发之后的第一个反向警示
- 『克制能力』(abstention)是 agent 安全的核心,但所有 harness 产品的优化目标都偏向『行动』。
- 研究论文2026-06-23 · 周二重要度 3/5深度报告 →
Grouped Query Experts:在注意力里做 MoE,KV cache 不变、预填充提速近 1.8×
Vishesh Tripathi 与 Abhay Kumar 的论文《Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention》(arXiv:2606.20945)把 GQA 分组内的查询头当作专家,由路由器为每个 token 选 top-k 个查询头专家,KV 头保持稠密、始终计算——从而完整保留 GQA 的 KV cache 优势,只削减激活的查询头算力。在 250M 参数 / 30B token 预算下,完整 GQE 三任务(HellaSwag/ARC-E/PIQA)平均 56.04,略高于稠密 GQA 基线 55.86;预填充在 4k–1024k token 区间提速约 1.67–1.80×。作者把这定性为「匹配而非提升」,并强调结论需在更大规模、多随机种子上复现。