#强化学习
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 研究论文2026-08-01 · 周六重要度 3/5
7月30日论文跟进|Qwen GUI 智能体入选 HF 日榜
Qwen-UI-Agent 论文原始提交早于窗口,7 月 31 日入选 Hugging Face Daily Papers。团队自报其使用 100 多台真机,并支持超过 100 轮在线强化学习轨迹。
- 当天增量是 HF 策展与社区关注,不是论文首次发布。
- 论文把 GUI、CLI 和批量动作统一到同一轨迹,但 benchmark 仍主要由团队自报。
- 工程实践2026-07-30 · 周四重要度 3/5
LMSYS 将 MXFP8 与 NVFP4 接入强化学习
LMSYS 团队在 Miles 中实现端到端 MXFP8 与逐 token NVFP4 强化学习。8 张 B200 的 Qwen3-30B-A3B 消融显示低精度奖励曲线接近 BF16。
- 价值在于训练、rollout、权重更新和量化器共享精度合同。
- 测试仍是单一模型与固定负载,不能外推为所有强化学习任务无损。
- 研究论文2026-07-24 · 周五重要度 3/5
AREX 用递归核查训练深度研究智能体
AREX 论文于 7 月 23 日首次提交 arXiv,提出内层研究与外层逐约束审计循环。团队训练了 4B 稠密模型和 122B-A10B MoE 模型。
- 论文把长时研究的关键问题定义为持续保存已验证证据并定位未解约束。
- 性能仍来自作者评测,成本、数据合成偏差和独立复现尚待公开。
- 研究论文2026-07-22 · 周三重要度 4/5深度报告 →
OpenAI 提出 Contrastive SDF 测奖励寻求
OpenAI 与 Apollo Research 发布奖励寻求研究。Contrastive SDF 让同一模型形成对评分者偏好的相反判断,再测量这些判断如何改变行为。
- 方法试图区分模型碰巧得高分与模型主动迎合评分机制。
- 它提供了训练期测量入口,但跨任务泛化、因果解释与阈值仍需外部复核。
- 研究论文2026-07-18 · 周六重要度 3/5
SEED 登上 HF 日榜第 2,技能蒸馏补足稀疏奖励
SEED 7 月 17 日登上 HF 日榜第 2,并更新结果图和模型页。论文 v1 为 7 月 16 日;示例模型创建于 7 月 15 日。
SEED 试图补上结果奖励与中间决策之间的监督缺口。关键风险是技能由当前策略自生成,错误经验也可能被强化。
- 研究论文2026-07-18 · 周六重要度 3/5
LongStraw 登上 HF 日榜,展示 210 万位置执行容量
LongStraw 7 月 17 日进入 HF Daily Papers,仓库同日首次公开;论文 v1 为 7 月 16 日。210 万位置结果只证明 RL 执行容量。
- 它解决的是执行图和显存管理,不是长上下文 Agent 已经训练成功。
- 作者主动写明 detached 状态和分布式路径仍不完整,这个边界比峰值数字更重要。
- 研究论文2026-06-28 · 周日重要度 2/5
论文:世界模型的幻觉是可预测、可预防的
一篇 arXiv 论文(Hallucination in World Models is Predictable and Preventable)研究世界模型(用于 agent 规划/仿真的环境预测模型)中的幻觉问题,主张这类幻觉并非随机不可控,而是可预测、可预防的,并给出相应的识别与抑制方法。
- 这条接在 Qwen-AgentWorld 等『把世界模型当 agent 训练第一性目标』的热潮之后,问到了点子上:如果要用世界模型做可控模拟器来替代真实环境训练 agent,那模拟器自己会不会『幻觉』出不存在的状态转移,就是整条路线成立与否的关键约束。
- 如果幻觉真的可预测、可预防,意味着世界模型作为 RL 训练环境的可靠性有了工程抓手
- 模型发布2026-06-26 · 周五深度报告 →
Qwen-AgentWorld:用「语言世界模型」当 agent 的训练场,但「超 Opus 4.8」要拆开看
通义千问开源原生语言世界模型 Qwen-AgentWorld,用单一模型模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,把「环境建模」当成从预训练第一天起的目标。开源 35B 总参/3B 激活的 MoE(256K 上下文)与 AgentWorldBench。核查后:真正超过 Opus 4.8 与 GPT-5.4 的是未明确开源的 397B 旗舰(58.71),开源的 35B(56.39)仅与 Opus 4.8 持平偏下;但「世界模型预热」对 7 项外部 agent 基准的零样本迁移增益(WideSearch +12.8、Claw-Eval +11.3)是更扎实的看点。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
Qwen-AgentWorld:把「环境建模」做成第一性训练目标的语言世界模型
阿里通义千问发布 Qwen-AgentWorld,用单一语言模型通过长思维链模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,开源 35B-A3B 与 397B-A17B 两档,基于超 1000 万条交互轨迹三阶段训练。提出「先预测环境、再行动」范式,既可作可控模拟器替代真实环境做 RL(增益超过真实环境训练),也可作预热阶段提升 7 项 agent 基准。当日 HuggingFace 最高票 136 upvotes。