#Code Arena
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 头条2026-07-03 · 周五重要度 5/5深度报告 →
24 小时,从"史上最强 Sonnet"到"订阅用户 7-7 起将用不到":Fable 5 重启后的三连击把 Anthropic 的最高能力民主化实验拉下了马
Claude Fable 5 在 7-1 全球恢复 24 小时后,三个独立维度同时遭遇重击:(1) @bridgemindai 在 BridgeBench 重测,Debugging 86.2 → 25.9、Refactoring 73.6 → 38.4、Hallucination 75.9 → 61.7,归因为新硬性护栏过度触发并回退 Opus 4.8;(2) @Hesamation「Fable 5 不是被 nerf,而是被屠杀」一贴 4,485 赞 / 364 转,@Khazix0918 实测 Fable 5 自主去火山引擎提交工单的 500 赞 / 11 万浏览帖,以及社区造出新词「disfabled」(disabled-by-safety)形成对照;(3) Anthropic Claude Code 团队成员 @trq212 7-2 22:49 UTC 官宣 Fable 5 将于 7-7 后从订阅下架,后续"视产能恢复回归订阅",与昨日公告中「7-7 前 Pro/Max/Team 含 50% 周配额免费额度、之后转 usage credits」路径相符;LMArena 同步数据:Fable 5 在 Code Arena:Frontend 仍居 #1 但已下滑 27 分,与 Anthropic 7-1 自承「new safeguards will flag a slightly higher fraction of harmless requests」一致。Anthropic 把「安全敏感性」抬高一档的工程取舍,正在被公开标注为「整套订阅价值被掏空」。
- 模型发布2026-06-27 · 周六深度报告 →
智谱开源 GLM-5.2(Max):753B/1M 上下文/MIT 协议,Code Arena 前端超越全部 Opus、仅次 Fable 5
智谱 AI 开源 GLM-5.2(Max),约 753B 参数、100 万 token 上下文、MIT 协议(据 HuggingFace 模型卡)。在 Code Arena 前端赛道以 1595 分排第 2、仅次 Claude Fable 5(1665 分),超越 Claude Opus 4.8 并在头对头中击败全部 Opus 变体(含 4.8/4.7 Thinking)。智谱自报 SWE-bench Pro 62.1、AIME 2026 99.2。All In 节目嘉宾 Sacks 估计中国模型落后约 9 个月、芯片落后约 24 个月,并称 GLM5 家族已用华为昇腾完成训练(此点模型卡仅确认昇腾推理,训练为单一来源待核实)。