#推理成本
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-27 · 周四重要度 4/5
Z.ai发布GLM-5.3-Flash成本模型
Z.ai 8月26日更新GLM-5.3-Flash官方页,称320B总参数、18B激活参数,在Artificial Analysis指数中每任务折扣价0.045美元。
- 这条的价值在成本叙事:Z.ai把国产AI芯片集群、EPD服务架构和多模态编码能力放在同一篇发布中。
- 分数和价格主要来自厂商与榜单,仍需真实工作负载验证。
- 行业动态2026-08-17 · 周一重要度 4/5深度报告 →
8月16日跟进|HN热议AI信用转售经济
Vectoral的8月10日旧文在8月16日登上HN前排,讨论AI信用转售:有30%到80%信用市场折扣和40%到50%转发报价。
- HN讨论把旧报告推回窗口,重点是灰色推理供给链如何被审计。
- 它提醒企业:模型调用成本下降背后,可能存在账号、积分和合规责任被拆开交易的二级市场。
- 行业动态2026-08-01 · 周六重要度 4/5深度报告 →
OpenAI 新披露成本与使用数据,降价是前一日事件
OpenAI CFO Sarah Friar 发布全栈成本文章,披露端到端服务成本降低 20% 等数据。文中所称 Luna 与 Terra 降价发生在前一日,并非再次降价。
当天增量是公司把模型、推理基础设施和需求增长放进同一成本叙事。关键运营数字仍是厂商自报,缺少绝对成本基线。
- 头条2026-07-27 · 周一重要度 5/5深度报告 →
Kimi K3 开源 2.8T 权重:智能指数 57 分,推理成本另算
月之暗面开源 Kimi K3 全部权重与技术报告,2.8T 总参数、104B 激活、896 选 16 专家、100 万 token 上下文。Artificial Analysis 智能指数给 57 分,落后 GPT-5.6 Sol(max)2 分。
- 行业动态2026-07-05 · 周日重要度 5/5深度报告 →
待验证|Jalapeño 是 OpenAI 的第二条硅路径:Broadcom 系 ASIC 想从 NVIDIA 嘴里抢下「推理」这块更大的蛋糕
OpenAI 与 Broadcom 2026-07-04 联合发布面向 LLM 推理优化的 ASIC 芯片 Jalapeño,是 NVIDIA 主线之外的第二条硅路径。三点核心判断:不是替代 NVIDIA,而是与 AMD 并列的多源兜底;锚点是单 token 边际成本而非训练吞吐;细节如工艺节点、量产时间、外采比例对从业者仍是黑箱。
- 行业动态2026-06-28 · 周日重要度 3/5
Coinbase 工程拆解:AI 支出砍半靠自建 LLM 网关 + 换默认模型 + 缓存路由
据 @markletree 转述 Coinbase 工程实现细节:本季度 AI 支出几乎砍半、token 用量持续攀升,全部请求走自建 LLM 网关(单一端点 + 格式,跨厂商故障转移、脱敏、日志、成本管控)。三招省钱:(1)更便宜的默认模型——91% 员工根本碰不到用量上限,于是不降配额、改默认廉价模型(据 CEO Brian Armstrong 称在试用 GLM 5.2、Kimi 2.7 等开源权重);(2)缓存——在 LibreChat 把命中率从 5% 拉到 60%;(3)缓存感知路由——对话缓存热时保持同一模型,TTL 失效后才重新选最优模型。
- 这是『开源追平』那条主线最硬的需求侧证据——而且它比『换个便宜模型』复杂得多。
- Coinbase 的关键洞察是:省钱的杠杆不只在模型单价,更在工程架构(网关 + 缓存命中率 + 缓存感知路由)。
- 行业动态2026-06-28 · 周日重要度 4/5深度报告 →
开源权重追平闭源前沿:差距稳定在 3-6 个月,企业开始大规模换模型
OpenRouter 6 月 Insights 博客《The Open Weight Models that Matter》给出一个关键判断:开源权重与闭源前沿的性能差距已稳定在 3-6 个月,且过去 18 个月没有被拉开——『差距真实但很窄,并未扩大』。支撑这个判断的是同时跨过『agentic 临界点』的四个开源模型:DeepSeek V4 Flash(约 2840 亿参数 MoE,SWE-bench Verified 79.0%,更大的 V4 Pro 拿到 80.6% 的开源最高分;首方定价输入/输出 $0.14/$0.28 每百万 token,输出成本约为 GPT-5.5 的 1/150)、智谱 GLM 5.2(Artificial Analysis 开源权重智能指数 51,列开源第一、仅落后 Claude Fable 5 约 5 分)、MiniMax M3(约 4280 亿参数,用 MiniMax 稀疏注意力 MSA 做原生文/图/视频长上下文,对标 Gemini Flash)、英伟达 Nemotron 3 Ultra(550B/55B-active 的 Mamba-2 混合架构,最强美国本土开源)。需求侧同步转向:据 @0xLogicrw 转述,Coinbase 把默认模型换成 GLM 5.2/Kimi 等开源权重后 AI 支出几乎减半(token 用量仍在涨)。注意:benchmark 多为厂商自报或第三方聚合,价格口径(首方/西方托管/含缓存)差异显著,需逐项看注。
- 模型发布2026-06-22 · 周一重要度 4/5深度报告 →
智谱 GLM-5.2 开源压成本:753B MoE、MIT 许可,自报 SWE-bench Pro 62.1
智谱(Z.ai)于 6 月 13 日发布开源 GLM-5.2:753B 参数 MoE(约 40B 激活)、MIT 许可、1M 上下文。官方自报 SWE-bench Pro 62.1(vs GLM-5.1 的 58.4)、Terminal-Bench 2.1 约 81.0,API 价约 $1.40/M 输入、$4.40/M 输出,折合约 GPT-5.5 的六分之一。本地部署据称需至少 8 张 H100(FP8)。
- 开源前沿模型『以价换量』的主线在 6 月持续:MIT 许可移除法律门槛,价格再压一个数量级,把推理成本压力直接传导给闭源厂商。
- 但要冷静看待——这些 benchmark 是厂商自报,各源对 Terminal-Bench 口径已出现分歧(81.0 vs 62/63.5),且本地跑满需 8×H100,真正的门槛从『许可』转向『算力』。