AI Radar先替你读,再把 AI 变化讲明白
EN
DeepSeek 视觉反转

DeepSeek 终于给 Flash 装上眼睛:一张图最多 384 tokens,价格却没涨

最后更新 2026-08-21编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
图片被压缩为最多 384 tokens,再送入 DeepSeek-V4-Flash-Vision-Exp 多模态 Agent 的原创信息图
编辑绘图:DeepSeek 视觉实验版与 V4 Flash 同价,每张图片最多计 384 tokens;“接近 Opus 4.8”来自 DeepSeek 自报基准,仍待独立实测。
一句话结论

DeepSeek-V4-Flash-Vision-Exp 已在官方 API 上线,支持 Chat Completions、Anthropic Messages 与 Responses API;每张图片最多折算 384 tokens,价格与 V4 Flash 相同。DeepSeek 称其多模态 Agent 能力已接近 Opus 4.8,但这是实验模型和厂商自报跑分,独立实测仍然缺席。

先说结论

DeepSeek 终于把“看图”能力送进了低价 Flash API,而且真正有杀伤力的数字不是跑分,是每张图片最多只算 384 tokens。

8 月 21 日,DeepSeek-V4-Flash-Vision-Exp 上线官方 API。它不是把图片先交给另一个模型转述,而是直接接受图文混合输入;价格与 V4 Flash 相同,并兼容 Chat Completions、Anthropic Messages 和 Responses API。

这让截图分析、网页操作、图表理解和视觉编程突然有了一个很便宜的新入口。但名字里的 Exp 不能忽略:这是实验模型,DeepSeek 公布的“接近 Opus 4.8”仍是厂商自报结果,今天还没有足够的独立实测证明它在真实 Agent 工作流里同样稳定。

DeepSeek 的反转:Flash 终于能直接看图

此前的 V4 Flash 是文本模型。开发者想让它理解截图,通常要在前面再接一个视觉模型:先把图片变成文字描述,再交给 Flash 推理。这能用,却会增加延迟、成本和信息损失。

现在只需把模型名设为 deepseek-v4-flash-vision-exp,就能直接发送图片。官方支持三种入口:base64 内联、公开图片 URL,以及先上传再用 file_id 引用的 Files API。

这个变化最适合 Agent,而不只是“识图聊天”。一个网页 Agent 可以看页面截图再决定点击什么;编程 Agent 可以读取报错截图或设计稿;办公 Agent 可以分析图表、扫描件和 PPT 页面。视觉不再是旁路工具,而能进入同一段对话和工具调用链。

真正狠的是 384 tokens,而不是“多模态”三个字

DeepSeek 会先按比例缩放图片,再把视觉内容折算成输入 tokens。官方规则写得很明确:每张图片最多消耗 384 tokens,大图不会因为像素继续增加而无限涨价。

价格表显示,Vision-Exp 与 V4 Flash 使用同一套费率:缓存未命中的百万输入 tokens,空闲时段为 1.5 元、高峰时段为 3 元;百万输出 tokens 分别为 4.5 元和 9 元。图片 tokens 与文本 tokens 一起计费。

按 384-token 上限粗算,一张图片对应的纯输入费用非常小。真正可能把账单推高的,不是单张图,而是 Agent 连续截屏、反复观察页面、失败后重试,以及随后生成的大量文本。便宜的是“看一眼”,不一定是“让 Agent 看一百眼”。

三套 API 都能接,Files API 让 Agent 少搬图片

这次不是只有一种 OpenAI 风格接口。官方文档确认三套调用路径都支持图像:

  • Chat Completions 可使用 image_urlfile 内容块;
  • Anthropic Messages 可使用 base64、URL 或 Files API,并在引用文件时携带 beta 请求头;
  • Responses API 使用 input_image,也能在工具输出中传回图片。

Files API 的价值不是“多一个上传按钮”,而是复用。同一张设计稿、扫描件或产品图只需上传一次,后续请求用 file_id 引用,不必每轮重复传输。官方还允许设置 1 小时到 30 天的有效期,也可以不设置有效期而永久保存;单个文件最大 64 MiB。

代价是数据治理更重要了。文件归属于 API key,永久保存并不总是好事。企业团队应主动设置过期时间、限制上传内容,并确认客户图片和内部文件是否允许进入第三方 API。

跑分接近 Opus 4.8?先看清是谁测的

DeepSeek 更新日志给出的 Vision-Exp 成绩包括 Terminal Bench 2.1 的 83.9、DeepSWE 的 59.3、ApexBench Pass@1 的 36.5,以及 Agents’ Last Exam 的 27.3。官方称它在需要视觉理解的 Agent Benchmark 上大幅超过文本版 Flash,并已接近 Opus 4.8。

这些数字有信息量,但不能直接翻译成“384 tokens 的 DeepSeek 已经等于 Opus”。首先,结果来自 DeepSeek 自己;其次,Code Agent 文本任务使用了 DeepSeek Harness 极简模式、max 档位、temperature=1.0top_p=0.95;最后,ApexBench 和 Agents’ Last Exam 中,纯文本 Flash 会忽略多模态元素,这让新旧差距本来就会很大。

目前可以确认的是:Vision-Exp 补上了 Flash 最明显的能力缺口。尚不能确认的是:它在密集 OCR、小字截图、复杂空间关系、连续多轮网页操作和幻觉控制上,是否真的达到顶级闭源模型的稳定性。

我们的判断:这是一张低价多模态 Agent 入场券

DeepSeek 这次最聪明的动作,不是再造一个“旗舰视觉模型”,而是把视觉能力接到已经便宜、并发高、Agent 生态逐渐成熟的 Flash 上。

对开发者来说,迁移成本也被压得很低:原有 DeepSeek base URL 不变,主要工作是换模型名、把消息 content 改成图文块,并处理文件生命周期。它更像一次 API 能力解锁,而不是要求你重写整套系统。

因此我们会给它一个谨慎积极的结论:值得拿真实任务做小规模 A/B 测试,但不值得因为一张官方跑分图立刻替换生产视觉模型。

适合谁现在试

  • 已经在用 V4 Flash,希望 Agent 能直接读取截图或设计稿的团队;
  • 需要批量分析商品图、票据、图表和网页截图,但对单次成本敏感的产品;
  • 想比较 Responses、Messages 与 Chat Completions 三种 Agent 接入方式的开发者。

仍然要观察

  • 独立评测能否复现 83.9、36.5 和 27.3 等官方成绩;
  • 384-token 视觉压缩对小字、密集表格和高分辨率界面的损失;
  • 实验模型的版本稳定性、限流、延迟和未来是否转为正式版;
  • Files API 的免费上传政策、存储治理和长期保留规则是否调整。