#研究论文
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 研究论文2026-07-05 · 周日重要度 5/5深度报告 →
桥水 + Tinker 把 Qwen3-235B 微调成金融筛选专家:84.7% Accuracy 反超 GPT-5.5,推理成本砍 13.8 倍
Bridgewater AIA Labs 在 Thinking Machines 的 Tinker 平台上,用 Qwen3-235B 做金融信息筛选任务微调,六项任务平均 Accuracy 84.7%,错误率比最强闭源前沿模型低 29.8%,推理成本下降 13.8 倍。
- 研究论文2026-06-28 · 周日重要度 3/5
论文:LLM 自动简历筛选可被提示注入攻破,单注入与多注入实测
一篇 arXiv 论文(Prompt Injection in Automated Résumé Screening with Large Language Models)研究用 LLM 做自动简历筛选时的提示注入攻击,在『单注入』与『多注入』两种设置下实测——求职者可在简历中嵌入隐藏指令操纵 LLM 的筛选/打分结果,从而不公平地抬高自己的通过率。
- 这是 prompt injection 从『安全研究者的演示』落到『高利害真实场景』的一个典型案例。
- 简历筛选直接关系到就业公平和企业合规,而越来越多公司在用 LLM 做初筛——这意味着攻击面已经实实在在地存在于招聘流水线里。
- 研究论文2026-06-28 · 周日重要度 2/5
论文:世界模型的幻觉是可预测、可预防的
一篇 arXiv 论文(Hallucination in World Models is Predictable and Preventable)研究世界模型(用于 agent 规划/仿真的环境预测模型)中的幻觉问题,主张这类幻觉并非随机不可控,而是可预测、可预防的,并给出相应的识别与抑制方法。
- 这条接在 Qwen-AgentWorld 等『把世界模型当 agent 训练第一性目标』的热潮之后,问到了点子上:如果要用世界模型做可控模拟器来替代真实环境训练 agent,那模拟器自己会不会『幻觉』出不存在的状态转移,就是整条路线成立与否的关键约束。
- 如果幻觉真的可预测、可预防,意味着世界模型作为 RL 训练环境的可靠性有了工程抓手
- 研究论文2026-06-28 · 周日重要度 3/5
论文:67 个前沿模型实测,Routing/Voting/MoA 的『协同失效上限』
一篇 arXiv 论文(When Does Combining Language Models Help?)在 67 个前沿模型上系统分析了 Routing、Voting、Mixture-of-Agents 三类『组合多模型』策略,提出『协同失效上限(Co-Failure Ceiling)』:当被组合的模型倾向于在同一批样本上同时犯错时,无论怎么路由、投票或混合,集成收益都存在一个由共同失败决定的天花板。
- 这篇给当下火热的 multi-agent / MoA 叙事泼了一盆必要的冷水。
- 业界默认『多个模型一起上总比单个强』,但这篇用 67 个模型的大规模实证指出:集成的收益不取决于你用了多巧妙的路由或投票,而取决于成员模型的错误是否相关
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
Execute-Distill-Verify:破解 agent 经验学习的「自我确认陷阱」
一篇新论文指出 agent 经验学习的核心失效模式——同一个 agent 既执行又评估,会把「错误但自洽」的轨迹当成有效经验写入记忆并越用越偏。EDV 用异构 agent 并行探索、第三方蒸馏、执行组共识校验三阶段解耦,τ²-bench 均分 Pass@1 86.6(对比 Router 83.5),且较 ReasoningBank 省 24.5% token。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
PlanBench-XL:1665 个工具的长程规划评测,前沿模型在「静默失败」前集体失灵
UIUC 团队提出交互式长程规划基准 PlanBench-XL:327 个零售任务、1665 个工具、56 种数据类型,工具需检索动态发现,平均约 25 轮、最短解 5–9 次调用。Gemini-3.1-Pro 最强(77.06%),GPT-5.4 默认 51.90% 但在最严重阻塞下崩到 11.36%,最小模型为 0%;探索度与准确率强相关(r=0.902),「静默失败」危害最大。
- 研究论文2026-06-23 · 周二重要度 3/5深度报告 →
Grouped Query Experts:在注意力里做 MoE,KV cache 不变、预填充提速近 1.8×
Vishesh Tripathi 与 Abhay Kumar 的论文《Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention》(arXiv:2606.20945)把 GQA 分组内的查询头当作专家,由路由器为每个 token 选 top-k 个查询头专家,KV 头保持稠密、始终计算——从而完整保留 GQA 的 KV cache 优势,只削减激活的查询头算力。在 250M 参数 / 30B token 预算下,完整 GQE 三任务(HellaSwag/ARC-E/PIQA)平均 56.04,略高于稠密 GQA 基线 55.86;预填充在 4k–1024k token 区间提速约 1.67–1.80×。作者把这定性为「匹配而非提升」,并强调结论需在更大规模、多随机种子上复现。
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
Confident Decoding:别只信最后一层,Qwen 用「熵谷」选层,训练免改还涨分
Qwen 团队联合清华、NTU 挑战『最后一层表征最优』:模型存在『先猜—精化—扰动』动态,末层可能把已经想清楚的预测推向对齐偏好 token(『对齐税』)。Confident Decoding 训练免改、保留完整前向,用熵在『熵谷』动态选层喂给采样器。实测 FLOPs 增量不到 1%、零额外 KV 显存;gpt-oss-20b 在 Omni-MATH 最难档 +22.4 分。