Topic Timeline
#RL
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 研究论文2026-08-22 · 周六重要度 3/5
8月21日跟进|EnvHarness日榜升温
8月21日跟进:EnvHarness登上HF Papers日榜并获234个upvotes,原论文发表于8月20日。
- 这条的news peg是日榜讨论和社区关注,论文原文发表于8月20日。
- 它的价值在于把环境生成从重建任务转为包装任务,降低为agent持续制造失败样本的工程成本。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
OpenThoughts-Agent:把 agentic 模型的训练数据配方完全开源
OT-Agent 针对「怎么为通用 agent 策展训练数据」这一公开知识空白,跑了 100+ 受控消融、组装 10 万样本微调 Qwen3-32B,七项 agent 基准均分 44.8%,比最强开源数据模型 Nemotron-Terminal-32B(40.9%)高 3.9 个点(SWE-Bench Verified 54.0% vs 41.9%)。配方逐项消融,数据、流水线、模型全部开源。
- 研究论文2026-06-23 · 周二重要度 5/5深度报告 →
PlanBench-XL:把前沿模型扔进 1665 个工具的「迷宫」,长程规划集体露怯
UIUC 团队提出 PlanBench-XL,用 327 个零售任务、1665 个需检索发现的工具、平均约 25 轮交互,评测 LLM 智能体在大规模工具生态下的长程规划。引入显性/隐性/误导三类工具阻塞模拟「缺失、失效、干扰」。GPT-5.4 无干扰准确率 51.90%,重度阻塞下骤降至 11.36%;Gemini-3.1-Pro 以 77.06% 领先,Qwen3-8B、Llama-3.1-8B-Instruct 为 0%。
- 这是当天最有分量的一篇:它把「agent 能不能用」的问题从单步工具调用提升到大规模工具生态 + 动态故障的真实复杂度。
- 最扎心的发现是『沉默失败最伤』