头条

Kimi K3 开源 2.8T 权重:智能指数 57 分,推理成本另算

权重、通信库、注意力算子与 Agent 环境同日开放,门槛转到部署侧。

2026年7月27日 · 周一深度报告高置信重要度 5/5

本文要点

  • 开放与闭源的综合指数差距,从以月计变成 57 对 59 的 2 分
  • 2.8T 总参数下每 token 只激活 104B,稀疏度推到 896 选 16
  • 训练侧基础设施随权重一起开放,MoE 通信与 Agent 环境不再是黑箱

阅读辅助

先看数字、证据和来源,再读正文。

2.8TKimi K3 总参数
104B每 token 激活参数
5 条 Claim Audit

Kimi K3 是当前 Artificial Analysis 智能指数上得分最高的开放权重模型,得 57 分。

6 个时间点

2026-04-20 · MoonshotAI/FlashKDA 仓库在 GitHub 建立,两天后生成 H20 基准文档,代码推送停在 2026-05-26

17 个来源10 个非 X 来源

57 分。这是 Artificial Analysis 给 Kimi K3 打出的智能指数分数,也是这次开源里最值得先记住的一个数。榜单上排在它前面的六条(含同一模型的不同推理档位)全部闭源,从 Claude Opus 5(max)的 61 分到 GPT-5.6 Sol(xhigh)的 58 分。K3 是这条分数线附近唯一一个可以直接下载权重的模型。

北京时间 2026-07-27,月之暗面公开了 Kimi K3 的全部权重与技术报告。GitHub 上 MoonshotAI/Kimi-K3 仓库在 16:01 建立,官方公告在 23:14 发出(23:03 先发预告推文),同期还开放了三个此前未公开的工程组件。

官方 README 给出的模型概览是:总参数 2.8T,每个 token 激活 104B,共 93 层,其中 69 层用 Kimi Delta Attention、24 层用 Gated MLA。路由专家 896 个、每 token 选 16 个,另有 2 个共享专家,上下文长度 1,048,576 token。

HuggingFace 上的 safetensors 索引给出更精确的数字:2,779,931,837,184 个参数,切成 96 个分片文件。视觉编码器 MoonViT-V2 只占 401M 参数,与模型总量相比几乎可以忽略。

有几处边界需要提前标注。Moonshot 自报的「相对 K2 提升约 2.5 倍扩展效率」没有公开测算口径,外部无从复核。官方评测表里 K3 的编码项用自家 Kimi Code harness 跑,而对手用 Claude Code 或 Codex harness,harness 差异未被控制。FlashKDA 公告里的 1.72–2.22 倍 prefill 加速,与仓库内 2026-04-22 生成的基准文档记录的 1.85–2.31 倍并非同一组测量,公告未说明新测量的条件。

受影响最直接的是三类人:需要在自有环境里跑前沿模型的企业买方、做推理服务的云厂商,以及此前把「开源模型落后一代」写进技术选型前提的团队。他们今天要重算的是同一笔账——权重能拿到之后,把它跑起来要付出什么。

2.8T 里真正被激活的是 104B

把官方 README 的模型概览铺开,K3 的架构选择比参数总量更值得看。

项目Kimi K3
总参数2.8T(精确 2,779,931,837,184)
每 token 激活参数104B
层数93(其中 1 层稠密)
注意力构成69 层 KDA + 24 层 Gated MLA
路由专家数896,每 token 选 16
共享专家数2
隐藏维度注意力 7168,专家 FFN 3072
词表160K
上下文长度1,048,576 token
视觉编码器MoonViT-V2,401M 参数
量化MXFP4 权重、MXFP8 激活,SFT 阶段起量化感知训练

激活率约 3.7%,稀疏度比常见的百分之十量级 MoE 更激进。官方把这套配置称为 Stable LatentMoE,并称它带来相对 Kimi K2 约 2.5 倍的整体扩展效率提升。这个数字是厂商自报,报告里没有给出计算基线,外部无法复核,只能当作方向性描述。

量化方案是另一个容易被略过的细节。K3 从 SFT 阶段就开始量化感知训练,权重用 MXFP4、激活用 MXFP8,官方给出的理由是拓宽硬件兼容性。HuggingFace 上的数值类型分布印证了这一点:2.72T 参数存为 U8(MXFP4 打包),只有 57.18B 保留 BF16,1112 万为 FP32。

这意味着下载下来的就是量化后的形态,没有「先拿全精度再自己压」这一步。对部署方是好事,省掉了一轮压缩与校准;对想研究后训练量化的人则少了一个全精度基线,也让「量化损耗有多大」这个问题在外部暂时无法测量。

分数核对:57 分放在榜单上是什么位置

社交媒体上流传的说法是「57 分,仅落后 GPT-5.6 Sol(max)2 分」。逐条核对 Artificial Analysis 官方页面后,这个转述成立,但需要补上完整的对照关系。

模型智能指数权重是否开放
Claude Opus 5(max)61
Claude Opus 5(xhigh)60
Claude Fable 5(with fallback)60
GPT-5.6 Sol(max)59
Claude Opus 5(high)59
GPT-5.6 Sol(xhigh)58
Kimi K357
Claude Opus 4.8(max)56
GLM-5.2(max)51
Gemini 3.6 Flash50
Qwen3.7 Max46
DeepSeek V4 Pro(max)44
MiniMax-M344

值得注意的是 K3 与国内同行的距离。它比 GLM-5.2(max)高 6 分,比 DeepSeek V4 Pro(max)和 MiniMax-M3 高 13 分。开放权重阵营内部的梯度,比开放与闭源之间的梯度更陡。

第三方对排名的表述并不完全一致。Nathan Lambert 在 Interconnects 的分析里写 K3 在 AA 智能指数上排第三、在 Vals AI 指数上排第二,而按当前榜单快照逐条比对(含同一模型不同推理档位的独立条目),排在 K3 之前的条目实际有六条,K3 位列第七。差异来自两点:榜单会随新模型上榜刷新,以及同一模型的不同推理档位在榜单上是独立条目——Lambert 的「第三」大概率是把同模型多档位合并计数后的排名。引用排名时需要注明快照日期与是否合并档位,引用分数则相对稳定。

官方评测表里赢在哪、输在哪

Moonshot 在 README 里放了一张覆盖推理、编码、智能体、视觉四大类的完整对照表。挑出差异最大的几项:

评测项Kimi K3Claude Fable 5GPT-5.6 SolGLM-5.2
GPQA Diamond93.592.694.191.2
HLE-Full(无工具)43.553.344.5
Terminal-Bench 2.188.388.088.882.7
FrontierSWE81.286.671.367.3
SWE-Marathon42.035.039.013.0
BrowseComp91.288.090.4
MCPMark-Verified94.587.492.9
GDPval-AA v2(Elo)1686174717361510
OmniDocBench91.189.885.8
ZeroBench(pass@5,带工具)41.046.035.0

模式相当清晰:K3 在需要多轮工具调用、长程检索和文档理解的项目上占优,MCPMark、BrowseComp、SWE-Marathon、OmniDocBench 都是这一类;在需要密集知识与深度单步推理的项目上落后,HLE-Full 落后 Claude Fable 5 9.8 分是最明显的一处(CritPt 上的差距见后文「反向的证据」一节)。FrontierSWE 上落后 Claude Fable 5 5.4 分,但同时领先 GPT-5.6 Sol 9.9 分

这张表有一处必须写明的方法学限制。README 脚注显示,K3 的多数编码项用自家 Kimi Code harness 评测,Claude 系列用 Claude Code、GPT 系列用 Codex。

harness 差异有多大,脚注里恰好留了两个可比对的数据点。Kimi Code Bench 2.0 上 K3 用自家 harness 得 72.9,换成 Claude Code harness 得 73.7;DeepSWE 上 K3 用 Kimi Code harness 得 67.5,换 mini-SWE-agent harness 得 67.3。两次换 harness 的波动都在一分以内。

脚注同时披露了对手侧的异常情况:Claude Fable 5 在 SWE-Marathon 评测中有 35% 的任务触发 fallback,在 Kimi Code Bench 2.0 的 80 个任务里有 13 次 fallback 和 1 次拒答,GPT-5.6 Sol 则有 10 次进入网络安全护栏。这些既是对手的真实表现,也说明对比条件并不完全对等。Moonshot 把它们写进脚注而非略过,比多数厂商的评测页更透明。

还有一处口径值得单独记下。BrowseComp 的 91.2 分是在 30 万 token 触发上下文压缩的策略下取得的;用满 100 万 token 上下文且不做任何上下文管理时,K3 得 90.4。更长的窗口没有换来更好的成绩,说明长上下文的价值取决于是否配合主动的上下文管理,而不是简单地把窗口开到最大。

原生多模态的成色

K3 把文本、图像与视频放进同一个模型,视觉编码器 MoonViT-V2 只占 401M 参数。README 的视觉分组里,K3 的强项与弱项同样分明。

文档理解是最突出的一项:OmniDocBench 91.1,领先 Claude Fable 5 的 89.8 和 GPT-5.6 Sol 的 85.8。视频侧 Video-MME(带字幕)得 90.0、MMVU 得 82.1,均小幅领先对照组。这两类都是把视觉当作信息载体来读取的任务,与 K3 在检索与文档类文本任务上的优势指向同一种能力。

需要更强视觉推理的项目上,差距反过来了。WorldVQA ForceAnswer 只有 51.0,落后 Claude Fable 5 的 56.7;BabyVision 带 Python 工具时得 85.7,落后 90.5;ZeroBench 在 pass@5、带工具的条件下得 41.0,落后 46.0。

PerceptionBench 是 Moonshot 自建的原子视觉感知基准,K3 得 58.5,低于 GPT-5.6 Sol 的 59.7。在自家出的题上没有占到便宜,这个细节反而增加了整张评测表的可信度。

权重之外:同一天放出的三件基础设施

比权重更少被讨论的,是同日开放的三个工程组件。它们分别对应训练 K3 这类模型的三个瓶颈。

组件解决的问题关键指标许可
MoonEPMoE 专家并行的通信负载不均每个 rank 恒定收到 S×K 个 tokenMIT
FlashKDAKimi Delta Attention 算子性能H20 上相对 FLA 基线 1.85–2.31 倍MIT
AgentENV大规模 Agent 环境的启停开销启动或恢复 <50ms,暂停与快照 <100msMIT

MoonEP 的思路是用动态冗余专家把路由倾斜抹平:无论 router 输出多不均衡,每个 rank 恒定接收 S×K 个 token。README 给出的对照是 DeepEP v2——在 H20、EP=8 的设置下,随着不均衡度上升,DeepEP 的迭代时间稳步攀升并最终因显存碎片 OOM,MoonEP 因为形状静态而保持平坦。这条约束会直接决定超稀疏 MoE 的训练能不能跑完,属于工程层面的硬门槛。

AgentENV 与 kvcache-ai 合作开发,用 Firecracker 微虚拟机加 overlaybd 按需加载镜像,支持把运行中的环境 fork 成多个独立沙箱。README 明确写它「支撑 Kimi K3 的 agentic RL 训练」。它还提供 E2B 兼容的 HTTP API,把 E2B_API_URL 指过去就能用现成 SDK。对想复现 agentic RL 训练流程的团队,这是比权重更稀缺的东西。

FlashKDA 需要单独说明。GitHub API 显示这个仓库建于 2026-04-20,最后一次代码推送停在 2026-05-26,仓库内的 H20 基准文档生成于 2026-04-22。也就是说,07-27 公布的是一份已经沉淀两个月的代码,而非当天赶工的产物;公告里的 1.72–2.22 倍与基准文档里的 1.85–2.31 倍是两组不同测量,公告未说明测量条件。合理的解释是公告采用了更新的内部数据,但仓库里没有对应脚本,外部暂时无法复现。

早报观点

这次发布把开放权重的竞争变量往前推了一格。过去两年评价一个开源模型,问的是「落后前沿几个月」;今天可以直接问「差几分」。Nathan Lambert 在 Interconnects 里把这个差距估为 3 到 5 个月,比此前的 6 到 9 个月明显收窄,而 AA 榜单给出的量化答案是 2 分。当差距可以用同一把尺子上的整数表达,采购方的决策语言就变了:从「要不要等开源追上」变成「这 2 分值不值这个价差」。

代价被移动到了另一侧。Artificial Analysis 在 K3 的模型页上写得很直接——它在开放权重模型中属于偏贵的一档,且明显偏慢、非常冗长。实测输出吞吐 33.3 tok/s,参考定价每百万输入 3 美元、输出 15 美元,仅智能指数一项评测就产出 1.3 亿输出 token。按该价位粗算,单这一项评测的输出侧开销就接近 2000 美元

权重可以免费下载,但 2.8T 参数意味着几乎没有团队能在单机上服务它。六家 Day 0 云厂商同时上线恰恰印证了这一点:开放的是模型,不包括运行模型的能力。这也解释了 HuggingFace 上 5386 个 like 对 2850 次下载的落差——想看的人远多于跑得动的人。

许可证进一步印证了这个判断。Kimi K3 License 对个人研究、内部使用和中小规模部署几乎没有限制,但对 MaaS 业务连续 12 个月收入超过 2000 万美元的主体要求另签协议,对月活超 1 亿或月收入超 2000 万美元的产品要求界面署名。条款精确地划在了「谁靠转售这个模型赚钱」这条线上。Moonshot 让所有人都能用,同时保留了向大规模转售者收费的接口。

反向的证据也要摆出来。K3 在 HLE-Full 上落后 Claude Fable 5 近 10 分,在 CritPt 上落后 GPT-5.6 Sol 8.9 分,这些都是密集知识与深度单步推理的项目——综合指数的接近,掩盖了能力分布上的实质差异。评测 harness 不统一是另一个未消除的变量。对需要长程 agent 执行的场景,K3 已经是可以进入候选名单的选项;对需要稳定深度推理的场景,2 分的差距不足以描述真实体验。

值得记住的还有资本效率这条暗线。Lambert 强调中国实验室融到的资金比美国 AI 生态的任何一个切片都少一个数量级,却把差距压到了个位数分差。他同时提醒,外界对中国实验室实际算力获取和数据实践「测量极其有限」,效率结论应当保留余地。这个提醒有必要——所有关于「用更少资源做到更多」的叙事,都建立在无法核验的分母上。

部署这一侧的账

官方推荐的推理引擎是 vLLM、SGLang 与 TokenSpeed,三者都已提供 K3 的 recipe 或 cookbook。API 侧在 platform.kimi.ai 选择 kimi-k3 即可,兼容 OpenAI 与 Anthropic 两套协议。

使用上有两个容易踩的约定。一是 K3 始终开启思考模式并返回 reasoning_content,思考强度通过顶层 reasoning_effort 字段控制,取值为 lowhighmax,默认 max。二是 K3 采用保留思考历史的训练方式,多轮对话和工具调用时必须把 API 返回的完整 assistant 消息原样传回 messages,包括 reasoning_contenttool_calls,而不只是 content。省略这部分会改变模型的输入分布。

六家 Day 0 合作方的侧重点各不相同。

厂商接入形态差异化说明
NebiusToken Factory 的 OpenAI 兼容 API 与控制台公告中给出 57 分与落后 2 分的表述
Fireworks推理加训练美国托管、零数据留存,支持点击式微调
BasetenModel APIsModel APIs 上 Day 0 上线,官方未给出进一步差异化说明
Modal自训推测解码为 K3 新架构训练 DFlash 推测器,称无质量损失
DigitalOceanServerless Inference接入 Inference Router 与模型合成
Together高吞吐推理美国托管、零数据留存,面向编码 agent 与生产负载优化

六家同时到位,本身就是 2.8T 模型难以自托管的侧面证据。其中 Modal 的做法值得单独注意:为一个刚开源几小时的新架构训练配套的推测解码器,说明服务商已经把「适配开放权重模型」当成常规工程流程,而不是一次性活动。

社区热度可以从仓库数据看出强度。截至采集时,MoonshotAI/Kimi-K3 已获 801 星,FlashKDA 591 星,AgentENV 368 星,MoonEP 272 星。三个基础设施组件都采用 MIT 许可,比模型权重的自定义许可宽松得多——工程工具无条件开放,模型本体保留商业接口,这是两条不同的策略。

接下来的观察窗口

最值得盯的是价格曲线。AA 记录的每百万输出 15 美元是当前托管口径,六家云厂商竞争之后能压到什么位置,将决定 K3 究竟是「可以下载的前沿模型」还是「可以负担的前沿模型」。这两件事之间的距离,比 57 分和 59 分之间的距离大得多。

其次是复现与验证。MoonEP 与 AgentENV 都是本周新建仓库,代码新鲜但缺少外部验证;FlashKDA 的加速倍数存在两组不一致的数字,需要社区脚本来确认。评测层面,如果有第三方在统一 harness 下重跑 FrontierSWE 与 Terminal-Bench 2.1,K3 与 Claude Fable 5 的真实编码差距才会有可比答案。

硬件路径同样值得跟踪。K3 原生 MXFP4 的设计意图是拓宽硬件兼容性,MoonEP 的 README 里已经写明 Zhenwu PPU 支持「审核中,即将到来」。如果这条路走通,开放权重的意义会从「谁能下载」延伸到「在什么芯片上跑」,而那是比榜单分数更长期的变量。