Topic Timeline
#Arena
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型评测2026-08-26 · 周三重要度 2/5
待验证|Qwen3.8登开源图生网页榜首
Arena 8月25日称Qwen3.8-27B在Image-to-WebDev Arena列开源模型第1、总榜第7,并给出1574分和27B参数口径。
- 这是有用的榜单信号,但今天主要来自Arena和Qwen的X传播。
- 早报把它降级处理,原因是榜单页面可见排名有限,完整项目变动仍需官方榜单或可复现实验补强。
- 产品上新2026-08-09 · 周日重要度 4/5深度报告 →
8月8日跟进|xAI介绍Image 2.0消费端状态
Grok官方账号于北京时间8月8日11:30介绍Imagine Image 2.0,并链接8月7日发布页。该页称模型已在网页、iOS与Android作为Quality Mode正式可用;API仍未开放。
- 状态变化落在消费端交付,而非又一次能力上调。
- Arena两项榜单可支持相对偏好位置,却不能替代文字、事实准确性和生产稳定性的独立评测。
- 研究论文2026-07-09 · 周四重要度 5/5深度报告 →
Gemma 4 技术报告上线 arXiv:开源权重扛起多模态与长上下文的新基线
Google DeepMind 把 17 页《Gemma 4 Technical Report》放到 arXiv(2607.02770);31B Dense 在 Arena 文本榜以 1451 Elo 锁定开源榜第 5、开源稠密段第 1(前 4 名均为 1T 级别 MoE),与 Gemini 3 同源,以 Apache 2.0 开放权重。
- 产品上新2026-07-05 · 周日重要度 3/5
Fable 5 重返 Arena,Battle Mode 加 Agent Mode 上线
Fable 5 重返 lmarena Arena,@petergostev 用 60 多个最难 3D 生成测试评价「可能是见过最令人印象深刻的模型」。已上线 Battle Mode 和 Agent Mode,官方排行榜分数即将公布。
- Fable 5 在 Arena 的真实测试比官方 demo 更有说服力:60 多个高复杂度 3D 任务涵盖建筑密度、艺术风格、世界奇观。
- 「官方排行榜分数即将公布」意味 Anthropic 从 benchmark 自评转向中立社区平台背书。
- 融资动态2026-06-30 · 周二重要度 4/5
Arena 跑通 $100M ARR:Agent Mode 上线百万级长时多回合工具调用,评估维度从人类偏好投票扩展到任务完成率/幻觉率
Arena(原 Chatbot Arena / LMSYS 衍生项目)公布商业化里程碑:评估产品上线仅 8 个月即达到 $100M 年化收入运行率。社区规模达数千万;Agent Arena 面向长时 Agent 在真实复杂任务上的工具调用、反馈适应、错误恢复与目标达成能力进行评估,正从人类偏好投票扩展到客观指标(任务完成率、幻觉率等)。
- 8 个月做到 $100M ARR 是 SaaS 史上最快之一,比 Cursor / Linear / Notion 早期都快。
- 更重要的信号是评估范式从『人类偏好投票』转向『客观指标(任务完成率/幻觉率)』——这意味着 evaluation 正成为与训练同级的独立产业。