少源|DeepSeek上线视觉实验模型
少源记录:接口已可按文档接入,性能与上线状态仍以DeepSeek自述为主。
本文要点
- DeepSeek API文档出现deepseek-v4-flash-vision-exp视觉输入路径。
- 图片可通过base64、外部URL或Files API进入三类兼容接口。
- Files API把重复图片从每次inline上传改成file_id引用。
阅读辅助
先看数字、证据和来源,再读正文。
V4-Flash-Vision-Exp已出现在DeepSeek发布页、Vision文档和Pricing表中。
2026-08-21 09:17 UTC · DeepSeek官方X称V4-Flash-Vision-Exp已上线API平台,并自述文本能力匹配V4-Flash。
发布锚点与少源边界
DeepSeek 这次更新的确定增量是 API 侧补上视觉输入:官方 X 在 2026-08-21 09:17 UTC 发出公告,DeepSeek API Docs 同域 news260821 页面也可抓取到同一发布内容,标题为 “DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Live”。这使它不只是 X 线索,至少有一条 DeepSeek 自有文档页承接发布说明。
已能核对的事实包括模型名 deepseek-v4-flash-vision-exp、Vision 文档中的图文输入方式、Files API 的 file_id 复用路径、Pricing 表中的上下文和价格,以及 Responses API 对 input_image 的字段约束。DeepSeek 还称该实验多模态模型在文本能力上匹配 V4-Flash,覆盖 agents、reasoning 和 world knowledge。
不确定部分同样需要前置。多模态 agent benchmark 相对 V4-Flash “major leap”并接近 Opus-4.8 的说法,仍主要来自 DeepSeek 发布页和官方 X。当前未看到公开任务集、评分脚本、第三方榜单或独立复现实测;因此本篇保持 confidence: low,标题、摘要和结论都按少源事件处理。
对开发者的直接意义比榜单更清楚:如果已经在用 DeepSeek 的 OpenAI 兼容接口、Anthropic-compatible Messages 或 Responses API,现在可以按文档把图片加入请求,并用 Files API 避免重复上传同一图片。对采购和评测方,合理做法是把这次发布视为“可开始验证的视觉实验模型”,而不是已被市场验证的多模态旗舰替代品。
证据层级需要拆开
这条新闻最容易误写的是状态动词和归因。DeepSeek 的发布语气很积极,但其中不少表述仍是厂商自报;中文稿件需要把“上线”“匹配”“接近”分别放在正确证据层级里。
| 信息类型 | 可确认内容 | 边界 |
|---|---|---|
| 上线状态 | DeepSeek自称模型已上线API平台 | 仍需第三方可用性探测 |
| 文本能力 | 官方称文本能力匹配V4-Flash | 不等同于多模态能力全面匹配 |
| benchmark | 官方称多模态agent测试明显提升 | 缺公开任务集和独立复跑 |
| 对标对象 | 官方称表现接近Opus-4.8 | 不推出已追平或已超过 |
| 图片计费 | 每张图片最多按 384 tokens 计费 | 不是固定每图384 tokens |
| 价格口径 | 图片按V4-Flash输入输出token价计费 | 视觉模型调用仍按tokens扣费 |
| Files API | 文件入口可用并支持file_id复用 | 当前文档聚焦图片文件 |
| 免费范围 | Files API入口免费使用 | 不代表模型推理免费 |
这个对照表决定了本文的写法。新闻钩子是 8 月 21 日上线;接口细节由文档支撑;性能和 benchmark 只写“DeepSeek 称”。如果后续出现独立测试,本条才适合从 low 上调到 medium。
接入形态:三条API路径和三种图片来源
Vision 文档把新模型定位为“接受图片和文本”的 API 模型,可用于描述图片、读取截图文字、分析图表等任务。它把视觉输入加进已有对话和 agent 调用路径,定位并非单独图像生成产品。
DeepSeek 在发布页称它支持 Chat Completions、Messages 和 Responses。文档拆开看,Chat Completions 使用 OpenAI-compatible 的 content block;Messages 对应 Anthropic-compatible 入口;Responses API 使用 input_image content part。三者背后的模型参数保持同一个:deepseek-v4-flash-vision-exp。
| 接入口 | 图片字段形态 | 适用场景 | 主要限制 |
|---|---|---|---|
| Chat Completions | 图文 content blocks | 现有 OpenAI SDK 迁移 | 图片只能放在用户侧图文输入中 |
| Messages | type: image 和 source | Anthropic-compatible 客户端 | file source 需要 files-api beta header |
| Responses | input_image content part | Codex式工具链和函数输出 | image_url 与 file_id 互斥 |
| Files API | 上传后用 file_id 引用 | 同一图片多次复用或大图输入 | 当前文档聚焦图片文件 |
图片来源也分三类。第一类是 base64 inline,适合本地小图,但编码后的数据计入 48 MiB request body limit。第二类是外部 HTTP(S) URL,URL 最长 8192 characters,图片文件最多 32 MiB,下载需在 60 seconds 内完成。第三类是 Files API 上传后的 file_id,单文件最高 64 MiB,更适合重复请求和超过 inline 限制的图片。
Responses API 的细节值得单独记录。文档写明 input_image 支持 image_url 或 file_id,两者互斥;detail 可取 low、high、original、auto,其中 low 会先降采样到 512x512,其他值保留原图。图片允许出现在 user、developer message item,以及 function_call_output 或 custom_tool_call_output 的输出中;放在 system 或 assistant 消息会返回 400。
这意味着新模型对 agent 的价值不只在“看图”。它可以读取工具返回的截图、图表或中间产物,再继续进入同一个 Responses 调用链。对自动化测试、浏览器 agent、文档审阅和数据看板分析来说,这比单轮“描述一张图”更接近实际工作流。
计费和限制:低价叙事也要看图片token
Pricing 页面把 deepseek-v4-flash-vision-exp 与 deepseek-v4-flash、deepseek-v4-pro 放在同一张表里。三款模型都列为 1M context length 和 384K max output;视觉实验模型的输入、输出价格与 V4-Flash 相同,FIM Completion 标为 not supported。
| 项目 | DeepSeek文档口径 | 解读边界 |
|---|---|---|
| 上下文长度 | 1M | Pricing表口径,不等于任意任务都应塞满上下文 |
| 最大输出 | 384K | 这是上限,不是默认输出长度或质量承诺 |
| cache hit离峰输入 | $0.007/1M tokens | 与V4-Flash同价,峰值为$0.014 |
| cache miss离峰输入 | $0.22/1M tokens | 与V4-Flash同价,峰值为$0.44 |
| 离峰输出 | $0.66/1M tokens | 与V4-Flash同价,峰值为$1.32 |
| 并发限制 | 2500 | Pricing表列出的模型级 concurrency limit |
| 单图计费上限 | 384 tokens | 图片按尺寸转token,每张独立计算 |
Vision 文档说明,图片会按尺寸转换成 tokens,并与文本 tokens 一起计费。图片先缩放:低于约 384x384 总像素的图片会等比例放大,高于约 768x768 的图片会等比例缩小;结果是每张图片有 384 tokens 的计费上限。一个请求包含多张图时,每张独立按同一规则计算,没有单独的多图合并算法。
请求层限制比价格更容易影响工程实现。Vision 文档列出最多 600 张图片;不含 file_id 图片时,请求内图片总大小最高 64 MiB;包含 file_id 图片时,总图片大小可到 200 MiB。单边最大尺寸为 8192 px,当请求包含 15 张或更多图片时,单边限制降到 4096 px。
Files API 另有存储约束:单次上传文件最多 64 MiB,上传必须在 10 minutes 内完成;文件名最多 512 characters;每个用户最大存储 25 GiB,最多存 10000 个文件;过期时间可设为 1 hour to 30 days,也可以省略过期字段永久保留。Anthropic-compatible Files API 需要 anthropic-beta: files-api-2025-04-14 header。
所以“按 V4-Flash 价格”不是一条完整成本结论。真实成本取决于图片数量、尺寸、是否命中缓存、文本上下文长度、输出长度和是否复用 file_id。如果一个文档处理任务需要数百张截图,384 tokens 的单图上限会让成本可估算;但它仍然是输入 tokens,不是免费视觉额度。
为什么这仍是低置信事件
发布页提供了比 X 更稳的非 X来源,但它仍是 DeepSeek 自有页面。它能证明 DeepSeek如何描述新模型、接口和计费,不能替代第三方可用性测试。尤其是“multimodal agent performance close to Opus-4.8”这句话,没有随页面公开具体分数、任务集、提示词、工具环境或评价脚本。
第二个限制是模型状态。标题中的 “Exp” 表明这是实验模型,文档也没有给出模型卡式的训练数据、风险说明、地区可用性或服务等级承诺。对生产系统而言,这些信息与 benchmark 一样重要;没有它们,就不应把它写成稳定旗舰模型上新。
第三个限制是 Harness。发布页称 DeepSeek Harness 0.1.1 当日发布并开箱支持新模型,但本文没有找到独立维护方或第三方测试报告来验证该版本带来的复现效果。若 benchmark 依赖特定 harness、工具包装或提示模板,那么模型能力与运行框架贡献需要拆开看。
第四个限制是比较对象。Opus-4.8 是发布页中的参照,而非本文独立抓到的榜单项。没有公开榜单链接时,更稳妥的表述是“DeepSeek称接近 Opus-4.8”。这类时态和状态差异,会直接改变读者对确定性的判断。
证据矩阵
| 证据 | 能证明什么 | 不能证明什么 |
|---|---|---|
| DeepSeek news260821 | 发布页存在,模型、接口、Files API和benchmark自述可核对 | 第三方已验证性能或服务稳定性 |
| DeepSeek Vision文档 | 图文输入、计费、limits和三类图片来源 | 上线当天真实流量下的成功率 |
| DeepSeek Files API文档 | file_id复用、上传限制、存储额度和兼容端点 | Files API会理解非图片文档 |
| DeepSeek Pricing页面 | 模型进入价格表,列出上下文、输出和价格 | 实际任务总成本一定低 |
| DeepSeek官方X线程 | 8月21日新鲜发布锚点和社交传播时间 | 非X独立确认 |
| Responses API文档 | input_image字段、工具输出图片和限制 | Codex长任务已经完整验收 |
对开发者和买方的实际影响
开发者最先受益的是接入路径清晰。已有 OpenAI-compatible 客户端可以先走 Chat Completions;使用 Anthropic-compatible 生态的团队可以看 Messages 和 Files API header;做 Codex式 agent 的团队则应优先验证 Responses API,因为工具输出图片进入模型的能力更贴近浏览器操作、自动测试和视觉调试。
对企业买方,评估重点应放在完整流程稳定性。文档解析场景要看多页截图的总 token、上传复用收益和错误恢复;客服场景要看图片、文本、工具调用混合后的延迟;数据分析场景要看图表读取准确率、拒答行为和可审计日志。
对模型厂商竞争格局,这次发布说明 DeepSeek 没有只把 V4-Flash 留在纯文本推理和代码 agent里,而是试图把同价策略延伸到多模态 agent。若它能在实际工作流中维持低价和长上下文优势,压力会传导给既有多模态 API;若 benchmark无法复现,影响则会收缩为一次文档和接口补齐。
对开源和工具生态,Files API 是一个容易被低估的变化。视觉 agent的高频开销往往来自同一截图、图表或附件在多轮请求中反复传输。file_id 复用能降低带宽和请求体压力,也让测试脚本更容易固定输入样本。不过这仍是 API 平台能力,不等于本地开源权重可用。
这条新闻的价值落在接口位置。DeepSeek把视觉输入接进了三套开发者已经在用的协议表面:Chat Completions、Messages和Responses。对agent工作流来说,协议位置比单点demo更关键,因为图片可以来自用户上传,也可以来自工具输出和重复引用的file_id。
早报判断是,当前最值得验证的是“V4-Flash价格体系下的多模态agent能否稳定完成真实任务”。“接近Opus-4.8”仍停留在厂商比较层,不能替代任务集和第三方复跑。如果同一张图最多 384 tokens、Files API可复用、上下文仍为 1M,它会给文档处理和浏览器agent一个很有吸引力的成本假设。但这个假设必须经过端到端成功率、延迟和错误恢复检验。
少源边界会限制今天的结论强度。DeepSeek自有发布页让“上线”不再只是X线索,文档也足以支撑接口写法和限制;但benchmark仍是厂商自述。真正能抬高置信度的证据,是公开评测任务、第三方复跑、可下载的Harness配置,以及不同账号和地区的可用性反馈。
因此,本篇把它放在“重要但待验证”的位置。它对开发者有立刻尝试价值,对企业采购还不够形成决策依据。后续若官方补模型卡和benchmark口径,或第三方证明多模态agent任务确实接近Opus-4.8,这条线才会从实验API补齐升级为模型竞争格局变化。
接下来看什么
可复现性是最先要看的信号。DeepSeek需要公开多模态agent benchmark的任务集、评分脚本、提示模板和Harness配置,否则“major leap”和“close to Opus-4.8”都只能当作厂商宣传语,而不是可比较的行业数据。
可用性决定它能否进入真实产品。发布页和Pricing表确认模型进入API文档,但生产系统还需要知道地区覆盖、账号权限、错误率、限流、SLA和版本变更节奏。实验模型如果频繁变更行为,企业侧就必须把它放进灰度和回退机制里。
成本曲线需要按完整任务衡量。图片 token 上限让成本变得可预估,但实际费用还取决于图片数量、是否命中cache、输出长度和多轮工具调用。更有意义的测试是用同一批截图跑完整任务,比较每个成功任务的总tokens和端到端时间。
Files API的边界扩展也值得跟踪。当前文档聚焦图片上传和复用;如果后续支持PDF、Office文档或批量上传,它会从视觉输入辅助功能变成更完整的文档上下文层。若范围长期只停留在图片,价值主要集中在截图、图表和视觉agent。
最后要看第三方生态接入。SDK、agent框架、评测平台和企业内部工具是否快速加入 deepseek-v4-flash-vision-exp,会比社交媒体热度更能说明开发者需求。尤其是 Responses API 中工具输出图片的路径,一旦被浏览器agent和自动化测试框架用起来,才会真正验证这次视觉实验模型的工作流价值。