本文要点
- V4-Flash API 从预览状态进入官方公开测试,并原生支持 Responses API。
- V4-Flash-0731 的 MIT 权重、编码示例和推理代码出现在 Hugging Face。
- 官方给出 Codex 配置路径,但适用范围暂时只有 deepseek-v4-flash。
阅读辅助
先看数字、证据和来源,再读正文。
V4-Flash-0731 在同一天启动官方 API 公测并发布 MIT 权重。
2026-04-26 · DeepSeek 提交 V4 技术报告,披露 Flash 预览版为 284B 总参数、13B 激活参数,并支持百万 token 上下文。
DeepSeek 把 V4-Flash-0731 的发布做成了一次紧凑的状态迁移:北京时间 7 月 31 日 14:56,官方 API 进入公开测试;约 34 分钟后,Hugging Face 记录到同名模型仓库创建,MIT 权重、推理脚本与编码示例随之进入公开验证范围。
这两个入口对应不同承诺。API public beta 意味着开发者可以通过 DeepSeek 的在线服务试用;开放权重则允许自行下载、部署和检查推理链。官方还给出 Codex 配置,原因是 DeepSeek API 已原生支持 Responses API。三者发生在同一天,缩短了从看到榜单到接入工作流、再到自部署复核的路径。
边界也写得很明确。DeepSeek 说 V4-Flash-0731 保持与预览版完全相同的模型架构和规模,不是再次扩大模型;本次升级 只适用于 V4-Flash API,V4-Pro API 以及 App、Web 中的模型暂时维持原状。模型页把 0731 称为取代预览版的正式权重发布,但 API 仍处于公开测试阶段,两种状态不能混写成全线正式商用。
当前适合立刻行动的是模型评测与工程验证。开发者可以用官方 API 检查 Responses 格式和 Codex 工作流,也可以下载 284B 总参数、13B 激活参数的权重测试推理。企业采购仍需等待输出速度、端到端延迟、常见硬件成本以及长任务稳定性的独立数据。
同日出现的三条验证路径
先看时间顺序。DeepSeek 官方账号先宣布 “Official API is now LIVE in public beta”,同时称 V4-Flash 原生支持 Responses API、已适配 Codex。官方随后补充适用范围和模型状态,避免把 Flash 的变化外推到 Pro 或 App、Web。
Hugging Face API 返回的 createdAt 为 2026-07-31T07:30:24Z,即北京时间 15:30:24;lastModified 为 12:02:14Z,即北京时间 20:02:14。这比依赖页面显示的相对时间更精确,也证明仓库是在目标窗口内新建,而非旧仓库改名后重新宣传。
模型仓库并非只有说明页。API 列出了 48 个 safetensors 权重分片、索引文件、编码脚本、推理实现和配置文件,仓库标签为 MIT、非私有、非 gated。模型页还给出 vLLM 示例,官方示例硬件是一台 4×GB300 节点,说明“权重可下载”与“普通单卡容易运行”之间仍有很大工程距离。
| 发布面 | 窗口内状态 | 可确认内容 | 暂不能推出的结论 |
|---|---|---|---|
| 官方 API | 公开测试 | V4-Flash 可调用,原生支持 Responses API | 不能写成已结束测试或全线正式商用 |
| Hugging Face 权重 | 正式权重发布 | MIT、48 个分片,含编码与推理示例 | 不能据此断言常见消费卡可低成本运行 |
| Codex 接入 | 当前可配置 | Flash 可通过 Responses 协议接入 Codex | 不代表 Pro 已支持,也不代表长任务已独立验收 |
| 模型架构 | 保持不变 | 与预览版相同结构和规模,带 DSpark 推测解码模块 | 不能写成参数再次增加或新架构上线 |
| 产品范围 | 仅 Flash API 升级 | Pro API 与 App、Web 模型暂时不变 | 不能把 Flash 成绩归到所有 DeepSeek 入口 |
模型页使用 “superseding the preview version” 描述 0731 权重,用 “substantially enhanced agentic capabilities” 描述能力变化;官方社交帖则说架构和规模完全相同。把这些信息合在一起,更稳妥的解释是:0731 的新状态来自正式权重、后训练能力和服务入口,而不是基础架构又改了一轮。官方没有披露后训练数据、训练步数或具体配方,进一步归因仍缺证据。
Codex 适配落实到协议与配置
DeepSeek 的 Codex 文档比一句“fully adapted”提供了更清晰的产品边界。文档说明 Codex 通过 Responses API 与模型通信,DeepSeek API 已原生支持该协议;配置中将 wire_api 设为 responses,模型设为 deepseek-v4-flash,并把 DeepSeek API 作为自定义 provider。
同一份配置由 Codex CLI、ChatGPT 桌面应用和 VS Code 的 Codex 扩展读取。这里的“适配”指协议兼容、模型目录和认证配置已给出,不代表 DeepSeek 模型变成 OpenAI 自有模型,也不代表 ChatGPT 订阅可以直接支付 DeepSeek API 费用。
适用范围暂时只有 Flash。官方文档写的是 “Currently, only deepseek-v4-flash supports integrating with Codex”,并称 deepseek-v4-pro 预计在 2026 年 8 月上旬支持。expected 是预期时间,不是已完成状态;在 Pro 文档或服务实际更新前,不能把它写成 Pro 同日完成适配。
Codex 兼容的价值在于复用现成智能体外壳。开发者可以把同一代码任务放进熟悉的终端、桌面端或 IDE 扩展,比较模型质量、调用费用和长任务行为,而不必先重写整套客户端。与此同时,工具调用可靠性、审批流程、上下文保留和中断恢复仍要在真实项目上验证。
模型权重侧也没有直接附带 Jinja 格式 chat template。DeepSeek 改为提供专门的 encoding 目录,演示如何把 OpenAI 兼容消息编码为输入字符串,再解析模型文本输出。这个细节说明,自部署复现不仅要下载权重,还要正确实现消息编码、reasoning effort 和工具协议。
厂商成绩与独立评测是两张表
DeepSeek 模型页公布了九项智能体、编码和工具使用结果。公开项目中,V4-Flash-0731 在 Terminal Bench 2.1 得到 82.7,预览版为 61.8,V4-Pro Preview 为 72.1;在 DeepSWE 得到 54.4,两款预览版分别为 7.3和 12.8。这些是厂商发布表中的数字。
官方还披露了运行条件:公开代码智能体任务使用 DeepSeek Harness 的 minimal mode,reasoning effort 为 max,采样参数为 temperature=1.0、top_p=0.95。问题在于 DeepSeek Harness 标注为 to be released,尚未公开;DSBench-FullStack 和 DSBench-Hard 又是内部测试集。因此,表格能证明官方报告了哪些结果,却暂时不能证明外部团队可以完整复现。
| 评测口径 | 结果或设置 | 证据性质 | 主要限制 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | DeepSeek 厂商自报 | 使用尚未发布的 DeepSeek Harness |
| DeepSWE | 54.4 | DeepSeek 厂商自报 | 使用 max effort 与指定采样设置 |
| DSBench-FullStack | 68.7 | DeepSeek 内部测试 | 测试集不公开,外部暂不能复现 |
| AA Intelligence Index v4.1 | 50 分 | Artificial Analysis 独立运行 | 组合指数只代表其九项评估与运行方法 |
| AA 同尺寸开放权重中位数 | 25 分 | Artificial Analysis 对照组 | 对照限于其“同尺寸开放权重”分类 |
| AA 评测总输出 | 2.10 亿 token | Artificial Analysis 独立记录 | 高 verbosity 会影响实际任务成本与等待时间 |
Artificial Analysis 是另一套口径。其 v4.1 智能指数由九项评估组成,包括 Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond 和长上下文推理等。V4-Flash-0731 在该指数上得到 50 分,在同尺寸开放权重模型中的对照中位数是 25 分。
这项独立结果支持“模型处于开放权重前列”的判断,但不能与 DeepSeek 的 82.7、54.4 等分数相加或平均。两边的任务集合、harness、采样与汇总方法不同。即使两套表都包含 Terminal-Bench 名称,具体代理框架和运行设置仍会改变最终表现。
Artificial Analysis 还记录了 284B 总参数、13B 激活参数和 1M token 上下文,与官方技术报告的预览版规模一致,为“架构和规模保持不变”增加了第三方交叉。价格方面,其页面列出每百万输入 token 0.14 美元、输出 0.28 美元、缓存命中 0.003 美元,并显示完整智能指数评测花费 72.02 美元。
价格低不等于任务成本必然最低。Artificial Analysis 的这次评测生成了 2.10 亿输出 token,同类中位数为 1.00 亿。高输出量可能来自更长推理,也可能受基准和运行设置影响;它提醒采购方把 token 消耗、任务成功率与等待时间一起计算,而非只看每百万 token 的标价。
规模没变,部署约束仍然很重
284B 总参数、13B 激活参数描述的是 MoE 模型的两个不同维度。每个 token 只激活一部分专家,有助于降低单 token 计算量,但完整权重仍要存储和调度。13B 激活参数不能被简化成“只需部署一个 13B 模型”。
4 月技术报告给出了架构背景:V4 使用结合 Compressed Sparse Attention 与 Heavily Compressed Attention 的混合注意力,并加入 mHC 和 Muon 优化器。报告中的 V4-Flash 预览版已经是 284B/13B、百万 token 上下文;0731 官方又明确保持结构和规模,所以这些材料只能解释继承的技术底座,不能充当 7 月 31 日的新架构新闻。
仓库中的 vLLM 示例使用 DSpark 推测解码,并以一台 4×GB300 节点为例。模型页把 DSpark 称为附加的 speculative decoding module,启动参数中设置 num_speculative_tokens=7。这为服务方提供了明确路径,但没有给出不同硬件的 tokens/s、首 token 延迟、并发曲线和能耗。
官方还建议 agentic 场景使用 temperature=1.0、top_p=0.95;在 high 和 max reasoning effort 下,建议最大输出长度为 384K token。这是最大输出配置建议,不是说每个任务都会生成 384K,也不能把它加到 1M 上下文形成新的窗口数字。
HN 的具体讨论集中暴露了评测后仍缺的工程信息。有人直接追问为何没有 tokens/s;有人质疑模型完成同一工作时的 token 消耗;也有开发者强调自己的代码库问答结果高度依赖 prompt 与 harness。它们属于社区观察,不是正式性能证据,但共同指向一个验证重点:智能体模型的可用性由模型、harness、编码与工具环境共同决定。
从榜单走向可复现任务
对开发者,最短路径是先用官方 API 固定一组真实任务。记录每项任务的输入、输出 token,工具调用次数,首 token 延迟,完成时间,重试次数和最终验收结果;随后在 Codex 中保持仓库、提示和权限一致,只替换 provider。这样才能知道协议兼容是否转化为工作流兼容。
第二步是区分 reasoning effort。模型支持 low、high 和 max 三档。官方 benchmark 采用 max,若生产环境为了延迟和成本使用 high 或 low,就不能直接拿官方最高档分数预测结果。每档都应单独建立质量与成本曲线。
对自部署团队,权重可得只是起点。需要验证权重格式转换、消息编码、DSpark、FP8 KV cache、expert parallel、长上下文内存和故障恢复。官方单节点示例可以用作配置参考,却不应被当作最低硬件门槛或稳定吞吐承诺。
对企业买方,应把 API 公测视为受控试验入口。public beta 通常意味着产品已经可公开使用,但服务等级、行为和接口仍可能变化。涉及生产代码、敏感仓库或跨境数据的团队,还需核对数据处理、区域、日志保留和采购条款;本次发布材料没有替这些问题给出答案。
同日开放权重和 API,让 DeepSeek 的竞争方式从“公布一个模型分数”推进到“让外部沿三条路径验证同一版本”。官方 API 提供低门槛试用,Responses API 把模型放进成熟的 Codex 工作流,MIT 权重则给服务商和研究团队留下自部署与复核空间。三条路径彼此约束,比单独发布一张 benchmark 表更有实际影响。
这次发布的核心增量落在后训练、智能体运行和交付方式。官方已经明确架构与规模保持不变,因此能力跃升不能被包装成参数扩张带来的自然结果。DeepSeek Harness 尚未公开,反而使 harness 成为下一阶段最关键的证据:若外部复现接近官方成绩,价值会从模型权重扩展到可迁移的智能体工程方法;若差距很大,官方榜单就需要重新拆分模型贡献与运行框架贡献。
Artificial Analysis 的独立 50 分提供了积极但有限的交叉。它说明 V4-Flash-0731 在另一套评估中仍处于领先开放权重区间,同时暴露 2.10 亿输出 token和速度数据缺失。低单价可能降低试错门槛,却不能自动解决高 token 消耗、延迟和本地硬件成本。
接下来最有价值的比较单位应是“一个可验收的真实任务”。只要把成功率、总 token、端到端时间、人工接管和部署费用放进同一张表,API 低价、Codex 兼容与开放权重才会变成可采购的优势。当前结论保持中等置信:发布状态和产品边界清楚,智能体提升的可复现程度仍待 Harness 与独立长任务数据补齐。
验证清单要盯住哪些变化
近期首先看 DeepSeek Harness。模型页已经写出 “to be released”,其公开时间、许可证、默认 prompt、工具协议与任务重试策略会决定厂商成绩能否被复跑。只有模型权重而缺同一 harness,复现链仍不完整。
第二组信号来自独立性能数据。Artificial Analysis 页面目前没有 output tokens per second,社区也在追问速度。后续需要同时观察首 token、生成速度、端到端时间和高分位延迟,尤其要按 low、high、max 分档。
本地部署要关注 4×GB300 之外的配置。量化版本、张量并行、专家并行和 SSD offload 可能降低准入门槛,但各自会改变质量、吞吐和稳定性。第三方能否在更常见硬件上复现百万 token 与智能体任务,决定“开放权重”能覆盖多大用户群。
Codex 侧应以真实仓库持续测试。工具调用格式泄漏、长上下文遗忘、错误自信、审批与中断恢复都比单轮代码生成更能决定生产价值。官方协议适配已经完成,工程可靠性仍需要外部证据。
最后要按状态词检查后续公告。Flash API 当前是公开测试;Pro 的 Codex 支持只是 预计 2026 年 8 月上旬;Pro API 与 App、Web 模型在 7 月 31 日仍保持原状。任何后续报道都应先确认它改变了哪一个入口,再讨论模型家族是否完成下一次迁移。