本文要点
- Kimi K3 从预期中的模型名,变成已上线 Web、Work、Code 与 API 的产品。
- 开放权重从泛泛表态,变成官方写明 7 月 27 日前的期限。
- 长上下文、多模态和代码能力被打包成同一前沿模型叙事。
阅读辅助
先看数字、证据和来源,再读正文。
Kimi K3 在本期窗口已上线多个官方入口。
2026-07-17 02:58 CST · Kimi 官方 X 宣布 K3 已上线 Kimi、Kimi Work、Kimi Code 和 API。
权重承诺是新闻钉子
Kimi K3 的当日新闻点可以压成一句话:Moonshot 在北京时间 7 月 17 日窗口内发布 Kimi K3 官方技术博客,并通过 Kimi 官方 X 宣布模型已上线 Kimi.com、Kimi Work、Kimi Code 和 Kimi API,同时承诺完整模型权重将在 2026 年 7 月 27 日前发布。发布当天交付的是应用与 API 入口,开放权重仍是一个带明确截止日的承诺。
官方 X 的核心原文包括三组状态:第一,Kimi K3 is now live on Kimi、Kimi Work、Kimi Code and the Kimi API;第二,Open Weights by July 27, 2026;第三,官方同时列出 2.8T 参数、100 万上下文、原生多模态、Kimi Delta Attention 在百万 token 上下文中最高 6.3 倍解码加速、Attention Residuals 约 25% 训练效率提升且额外成本低于 2%。其中 “now live” 只覆盖产品和 API 入口,“by July 27” 是未来时态的承诺。
技术博客补充了同一边界。博客写道,Kimi K3 是 2.8T 参数模型,基于 Kimi Delta Attention 和 Attention Residuals,具备原生视觉能力和 1-million-token context window。博客还写明:At launch,Kimi K3 默认使用 max thinking effort,低努力和高努力模式将在后续更新中引入;团队正在与推理伙伴和开源维护者对齐技术细节,以保证生态推出可靠;完整模型权重 will be released by July 27, 2026。
这几句决定了本期的写法。Kimi K3 已经能在官方入口试用,也可以通过 Kimi API 选择 kimi-k3。开放模型生态还需要权重、许可、模型卡、推理配置和可复现实验这些关键物料。7 月 17 日这一天,Moonshot 给出的不是这些文件的完成交付,而是一个时间明确的开放承诺。
关键数字怎么读
| 数字 | 官方原文或口径 | 本文采用的中文表述 | 需要保留的边界 |
|---|---|---|---|
| 2.8T 参数 | 2.8T-parameter model | Kimi K3 官方自称 2.8T 参数模型 | 参数规模来自发布方,仍需权重文件和模型卡核验 |
| 100 万上下文 | 1-million-token context window | 支持最高 100 万 token 上下文 | 真实延迟、价格和召回质量需第三方实测 |
| 7 月 27 日前 | will be released by July 27, 2026 | 完整权重承诺在 7 月 27 日前发布 | 不能写成 7 月 17 日已经开放 |
| 6.3x 解码 | up to 6.3x faster decoding | 百万 token 上下文最高 6.3 倍解码加速 | “up to” 是上限口径,不代表所有场景 |
| 25% 训练效率 | about 25% higher training efficiency | Attention Residuals 自报约 25% 训练效率提升 | 基准来自官方,非独立复现 |
| 低于 2% 成本 | at under 2% additional cost | 额外成本低于 2% | 需知道内部基线和硬件设置才能横向比较 |
这里最容易写错的是时态和基准。官方没有说“权重已开放”,而是说“将在 7 月 27 日前发布”。官方也没有说所有百万 token 场景都会 6.3 倍加速,而是 “up to 6.3x”。25% 训练效率和低于 2% 额外成本属于同一个自报技术收益句子,不能拆成两个已被外部验证的结论。
博客中还给了 API 使用口径:开发者可在 Kimi API 平台选择 kimi-k3,价格写作 cache-hit input 为每百万 token 0.30 美元,cache-miss input 为每百万 token 3.00 美元,output 为每百万 token 15.00 美元。官方同时称 Mooncake 的分离式推理架构在编码工作负载中让官方 API cache hit rate 高于 90%。这组价格和缓存命中率有助于判断早期 API 成本,但仍是官方服务口径,不等价于开放权重部署成本。
开放承诺的分量
Kimi K3 的重要性来自组合交付。Moonshot 把一个 3T 级别附近的前沿模型同时放进终端应用、桌面工作流、代码 Agent、API 和后续开放权重路线里。对普通用户来说,今天能感知到的是 Kimi.com、Kimi Work、Kimi Code 的模型切换。对开发者来说,今天能测的是 API、Kimi Code 和长任务行为。对开放模型社区来说,真正决定生态影响的文件要等到官方承诺的 7 月 27 日前。
官方博客把 Kimi K3 描述为 “world’s first open 3T-class model”。这句话的风险在于,“open” 在发布当天仍处于承诺期。博客正文同时承认,Kimi K3 的总体表现 still trails the most powerful proprietary models, Claude Fable 5 and GPT 5.6 Sol,但在自己的 evaluation suite 中展示了 frontier-level performance,并且相对其他测试模型表现稳定。这个表述比社区传播里的“全面超过闭源模型”谨慎得多。
从技术叙事看,Kimi Delta Attention 和 Attention Residuals 是 Moonshot 试图解释“大规模长上下文如何仍然可用”的核心。KDA 被描述为更适合扩展 attention 的基础,AttnRes 被描述为跨深度选择性取回表示,而不是统一累积。博客还提到 MoE 稀疏化,激活专家数为 16 out of 896。对于模型团队,这些信息说明 K3 的卖点覆盖参数规模、上下文长度、视觉能力、Agent 编码和推理成本之间的组合。
但这些组合价值最终要落到可部署性。开放权重发布后,社区才会知道许可是否允许商业使用、是否允许微调、是否有安全使用限制、推理配置是否完整、量化和多机推理是否有参考实现。若这些条件缺失,2.8T 参数反而可能变成部署门槛;若这些条件齐全,K3 才可能从“可试用的大模型”变成“可进入企业和开发者基础设施的开放底座”。
社区榜单只能当信号
采集结果里有多条 Kimi 官方转推或社区转述。Arena 称 Kimi-K3 在 Frontend Code Arena 拿到 1679 分并排第 1,Kimi 从第 18 升至第 1。Kimi 还转发了 Next.js Evals 相关观察,称 K3 在相关任务上表现领先 Fable,并以更短时间达到可比成功率。另有 Artificial Analysis 和 ValsAI 的排名线索,采集到的文本显示 Kimi K3 在 Intelligence Index 或 Vals Index 中取得较高位置。
这些都可以解释“为什么开发者社区当天很兴奋”,但不能直接写成独立复现的确定事实。原因有三点。第一,部分内容来自官方转推,转推本身不是第三方完整报告。第二,不同榜单的任务、harness、模型温度、推理努力级别、工具调用权限和失败处理方式差异很大。第三,Next.js Evals 页面本身写明指标是 success rate、average duration 和 average list cost,并且其公开页面记录的 last run date 是 2026 年 8 月 5 日,不能作为 7 月 17 日当天的新鲜事实锚点。
因此,本期把社区榜单放在“观察信号”而不是“核心事实”位置。能写的是:Kimi K3 发布后,Arena、Next.js Evals、Artificial Analysis 等社区和榜单开始把它纳入比较,说明模型已进入开发者基准讨论。不能写的是:Kimi K3 已经被这些榜单独立证明全面超越某个闭源模型。前者是传播和验证过程,后者是过度外推。
为何重要
Kimi K3 对中国模型厂商的意义,是把“产品入口”和“开放底座”重新放到同一条发布线上。过去一段时间,国内模型发布常见两种路径:一种是先把能力塞进聊天产品和办公工具,开放生态后置;另一种是先上权重和论文,产品体验较弱。Kimi K3 这次选择同时讲应用、API、代码 Agent、长上下文、多模态和开放权重期限,等于把不同受众的等待时间压到同一个窗口。
对开发者而言,这会改变评估顺序。7 月 17 日以后,开发者可以先用 Kimi API 和 Kimi Code 看模型在真实仓库、长上下文检索、前端生成、工具调用里的行为;但如果要判断是否能纳入私有部署、行业微调或本地推理栈,仍然要等权重、许可和部署说明。也就是说,今天能做的是产品试用和 API 探路,不能做的是完整开源生态结论。
对模型团队而言,K3 的参数规模和长上下文主张会把竞争问题推向系统工程。2.8T 参数意味着推理成本、显存切分、通信开销、缓存复用和长上下文调度都会成为真实问题。官方提到 Mooncake 架构、缓存命中率和百万 token 解码优化,说明 Moonshot 知道发布大参数模型不是只给一个权重文件。后续如果开放权重,还需要配套推理栈和工程文档,才可能让模型在外部团队手里可用。
对企业买方而言,Kimi K3 值得关注但不宜马上按“开放可控”来采购。API 和应用入口代表可试用,开放权重承诺代表可期待,二者之间还差许可证、合规说明、安全评估和成本模型。尤其是 100 万上下文,多数企业真正关心的不是窗口上限,而是在长合同、代码库、审计材料和知识库中是否能稳定找回关键事实,并且价格和延迟是否可控。
它也让“开放模型”的定义更严格。只说参数规模和 benchmark 不够,必须同时交付权重、使用条款、部署说明和可复现实验。Kimi K3 已经把注意力拉到了这个位置,但在权重实际开放之前,所有生态影响都应该写成条件句。
验证清单
后续先看 7 月 27 日前是否准时开放完整权重。若延期,今天的主线就会从开放前沿模型变成开放承诺未兑现。
许可条款会决定企业采用空间。开放权重不等于开源自由使用,商业使用、再分发、微调、模型输出和安全条款都会影响部署判断。
模型卡和技术报告需要补齐基线、硬件、任务和统计口径。2.8T 参数、100 万上下文、6.3x 解码和 25% 训练效率都需要被放进可复验环境。
第三方复测要优先看公开任务、可复跑 harness 和稳定样本。Arena、Next.js、Artificial Analysis、ValsAI 等榜单可以提供线索,但不能替代复现。
推理生态是最后一道门槛。对于 3T 级模型,下载权重只是开始,服务化、量化、缓存和长上下文调度才决定它能否进入实际工作流。