#Artificial Analysis
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 头条2026-07-27 · 周一重要度 5/5深度报告 →
Kimi K3 开源 2.8T 权重:智能指数 57 分,推理成本另算
月之暗面开源 Kimi K3 全部权重与技术报告,2.8T 总参数、104B 激活、896 选 16 专家、100 万 token 上下文。Artificial Analysis 智能指数给 57 分,落后 GPT-5.6 Sol(max)2 分。
- 模型发布2026-07-07 · 周二重要度 4/5深度报告 →
待验证|阿里 Fun-ASR 把流式首字压到百毫秒,顺手把离线榜也抢到第一
通义实验室 Fun-ASR 系列拆成两条产品线推向市场。Fun-ASR-Flash 在 Artificial Analysis 字错率榜以 AA-WER 1.7% 拿下 58 个模型中的第一;Fun-ASR-Realtime 把流式语音的首字延迟压到 100ms 级,声称逼近离线精度。
- Paraformer 与 Fun-ASR 系正在替代 Whisper 系成为国内中文 ASR 的默认起点。
- 榜一事件、Paraformer-zh-streaming 进 vLLM、Fun-ASR-Nano 中文 CER 8.20% 三件事合在一起,中文场景下『最划算的开源 ASR 基线』已经位移
- 产品上新2026-07-02 · 周四重要度 4/5深度报告 →
智谱把 GLM-5.2 装进 IDE:1.5x 额度 + BYOK 绑定 Anthropic/OpenAI 订阅,国产模型首次正面抢开发者桌面
智谱(Z.ai)7-1 正式发布 GLM-5.2 官方 IDE「ZCode」——HN 双帖合计 382 分(266 + 116,176 评论登首页),定位「Claude Code from the Makers of GLM」。三个真正改变桌面竞争格局的设计:(1) GLM Coding Plan 订阅者在 ZCode 内使用 GLM-5.2 时额度直接翻 1.5x,具体实现是「高峰 3x→2x / 非高峰 1x→0.67x」分时折扣系数;(2) BYOK 机制允许用户在 ZCode 中直接配置 Anthropic Claude / OpenAI Codex 等第三方订阅或 API key——ZCode 不再是「GLM 专属 IDE」而是「支持 GLM 优先 + 第三方模型 fallback」的桌面代理;(3) macOS(Apple Silicon + Intel)、Windows(x64 + ARM64)、Linux(x64/ARM64, .deb + .AppImage,Beta)全平台客户端 v3.2.2,搭配 3M GLM-5.2 tokens 初始额度(GLM 5.2 是 744B/40B-active、MIT 许可、1M 上下文、Intelligence Index 51、$1.4/$4.4 per MTok 的开源旗舰)。这是国产开源模型厂商第一次从「API 提供方」迁移到「开发者桌面 + 订阅生态」的产品尝试——同一周 SpaceX 宣布以 $60B 收购 Cursor 母公司 Anysphere,意味着 AI 编码桌面正在变成大模型厂商的必争之地。
- 研究论文2026-07-01 · 周三重要度 5/5深度报告 →
OpenAI 推 GeneBench-Pro:129 道合成题把研究级智能体评估从『答题』推向『研究决策』,GPT-5.6 Sol 高档仅 28.7%
OpenAI 发布研究级基准 GeneBench-Pro,把 AI 智能体在计算生物学中的评估从『答得对』推向『能否独立做出研究级判断』,覆盖统计遗传学/群体遗传学/定量遗传学/调控组学/功能基因组学/蛋白质组学/临床-PGx-诊断/癌症基因组学/微生物基因组学/法医遗传学共 10 大域、21 个子域、129 道合成题——每道题都用已知因果结构的合成数据集,可直接模拟、绕开作者偏好。所有题经外部专家审核,UCLA Alexander Strudwick Young 给出的评价是『对没有资深导师反复指导的研究生来说都很难』。GPT-5.6 Sol 在最高推理档通过率 28.7%(Pro 模式 31.5%),最低档个位数;解题数约为 GPT-5.2 的 6 倍,token 消耗只有 2/3。GPT 与开源模型(GLM 5.2 等)的科研推理差距显著大于代码差距——说明开源更偏代码。人类专家估时 20-40 小时/题、$200/h 即数千美元,而推理成本仅几美元/题。10 题已开源至 Hugging Face,50 题将给 Artificial Analysis;OpenAI 预判年底该基准会被刷满。
- 行业动态2026-06-28 · 周日重要度 4/5深度报告 →
开源权重追平闭源前沿:差距稳定在 3-6 个月,企业开始大规模换模型
OpenRouter 6 月 Insights 博客《The Open Weight Models that Matter》给出一个关键判断:开源权重与闭源前沿的性能差距已稳定在 3-6 个月,且过去 18 个月没有被拉开——『差距真实但很窄,并未扩大』。支撑这个判断的是同时跨过『agentic 临界点』的四个开源模型:DeepSeek V4 Flash(约 2840 亿参数 MoE,SWE-bench Verified 79.0%,更大的 V4 Pro 拿到 80.6% 的开源最高分;首方定价输入/输出 $0.14/$0.28 每百万 token,输出成本约为 GPT-5.5 的 1/150)、智谱 GLM 5.2(Artificial Analysis 开源权重智能指数 51,列开源第一、仅落后 Claude Fable 5 约 5 分)、MiniMax M3(约 4280 亿参数,用 MiniMax 稀疏注意力 MSA 做原生文/图/视频长上下文,对标 Gemini Flash)、英伟达 Nemotron 3 Ultra(550B/55B-active 的 Mamba-2 混合架构,最强美国本土开源)。需求侧同步转向:据 @0xLogicrw 转述,Coinbase 把默认模型换成 GLM 5.2/Kimi 等开源权重后 AI 支出几乎减半(token 用量仍在涨)。注意:benchmark 多为厂商自报或第三方聚合,价格口径(首方/西方托管/含缓存)差异显著,需逐项看注。