DeepSeek 最便宜的模型现在拥有了视觉能力。2026 年 8 月 21 日,DeepSeek 发布了 deepseek-v4-flash-vision-exp。这是 V4-Flash 的视觉启用版本,可以通过相同的生产环境接口接收图像,价格与纯文本模型相同,每张图像计费不超过 384 个输入 Token。官方发布说明对此的定位非常明确:拥有与 V4-Flash 相同的文本处理能力,并新增了图像理解功能。据 DeepSeek 称,这使其多模态 Agent 性能逼近 Opus 4.8。
本指南将介绍该模型是什么、名称中的“Exp”对生产环境使用意味着什么、发送图像的三种方式、需要注意的限制,以及如何正确测试多模态请求。由于视觉请求混合了多种内容类型且数据量增长迅速,因此它们非常适合在 Apifox 中构建,而不是在终端中手动编辑 JSON。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
什么是 deepseek-v4-flash-vision-exp
该模型是在 V4-Flash-0731 的基础上附加了图像编码器。根据 DeepSeek 的说法,它在文本任务上(包括 Agent 工作负载、推理和世界知识)与基座模型表现一致,因此你可以直接进行替换,而不会丢失 V4-Flash 原有的任何功能。OpenRouter 上的信息将其描述为一个稀疏混合专家(MoE)模型,在总计 284B 的参数中,激活参数为 13B。
一个重要的背景是:V4-Flash 是 DeepSeek 的高性价比产品线。我们在 DeepSeek V4-Flash API 指南中曾对该文本模型的发布进行过报道,其经济效益至今未变。以 Flash 级别的定价提供视觉能力,几乎击穿了市场上所有多模态 API 的价格底线,这也是为什么 DeepSeek 官方宣称的“在多模态 Agent 基准测试中逼近 Opus 4.8”这一说法备受关注的原因。不过,厂商的基准测试声明仅供参考;在进行任何迁移之前,建议针对你自己的文档运行自己的评估。
尽管带有实验性标签,但这并非只是沙箱里的玩具。该模型运行在生产环境 API 接口上,拥有与其他 V4 模型相同的速率限制和 SLA,且无需排队或申请特殊访问权限。
定价:Flash 级别费率,包含图像
根据 DeepSeek 的定价页面,其资费标准与纯文本版 deepseek-v4-flash 完全相同:
图像在计费时会被转换为 Token,每张图像最多计算为 384 个 Token,并按输入费率收取。在高峰期缓存未命中的定价下,一张满额计费的图像成本约为 0.00017 美元。一千张图像的成本比一杯咖啡还便宜。
有两种计费规则是从文本模型继承而来的。非高峰时段的费率是高峰时段的一半,工作日的高峰时段为 UTC 时间 01:00 至 04:00 以及 06:00 至 10:00,因此在此时间窗口之外调度的批量视觉任务成本仅为一半。此外,上下文缓存适用于重复的输入,这在配合不同的图像重复发送相同的系统提示词时非常有用。价格页面列出了 V4 系列的 1M-token 上下文窗口,但在实际操作中,输出上限远低于该值。
发送图像的三种方式
该模型通过 DeepSeek 的标准 Chat Completions 接口 https://api.deepseek.com/chat/completions 工作(正如 V4-Flash Responses API 推出时所确立的那样,也支持 Messages 样式和 Responses 样式的调用)。图像包含在用户消息的 content 数组中,您有三种发送选项。
1. Base64 内联。 将图像编码为 data URL。简单、独立,且每张图像的大小上限为 32 MiB:
import base64
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
with open("invoice.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extract the line items and totals as JSON."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
]
}]
)
print(response.choices[0].message.content)
2. 外部 URL。 传入一个可公开访问的链接(最多 8,192 个字符)而不是进行编码:
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
3. Files API 引用。 一次上传,通过 ID 重复使用。DeepSeek 的 Files API 现在免费支持图像上传,通过 file_id 引用可以避免在不同请求之间重复上传相同的图像,并且每张图像的上限提高到了 64 MiB:
{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}
对于单次调用,请使用 base64;当您的图像已经托管在 CDN 上时,使用 URL;对于任何需要多次处理同一张图像的工作流,请使用文件 ID。
detail parameter
每张图像上的可选 detail 字段可控制预处理:
"low":降采样至 512x512。最便宜且最快,适用于分类级别的任务。"high"/"original":保留原始尺寸,适用于密集文档和微小文本。"auto":由 API 决定。
在内部,图像会被规范化到大约 800x800 以进行 token 计数,这就是每张图像 384 个 token 上限的计算方式。如果您在收据或仪表盘上进行类似 OCR 的工作,请在您的真实语料库上对比测试 "low" 和 "high";在当前的价格下,成本差异很小,但准确率的差异可能会很大。
“Exp” 对你意味着什么
这个后缀是诚实的标注,而不是付费墙。请做好模型在短时间内被修改或替换的准备,就像之前实验性的 DeepSeek 接口一样。实用的应对策略:
- 不要在十几个地方硬编码模型 ID。 将
deepseek-v4-flash-vision-exp放在单个配置值或环境变量中。 - 保留纯文本备选方案。 由于该模型在文本处理上与
deepseek-v4-flash一致,因此将非图片流量路由到稳定版的 ID 不会产生额外成本。 - 为你的评估(evals)保留快照。 当非实验性的后续版本上线时,你会希望在自己的任务上进行前后对比,而不是依赖供应商的评估。
实例分析:文档处理流水线的成本
数字能让定价更加具体。假设你每月处理 50,000 张扫描的发票,每张发票包含一张图片,每次调用包含 200 个 Token 的指令提示词以及大约 400 个 Token 的 JSON 输出:
- 图片输入:50,000 x 384 Token = 19.2M Token。在缓存未命中的峰值费率下($0.44/1M),费用为 $8.45。
- 文本输入:50,000 x 200 = 10M Token,峰值费用约为 $4.40。如果对重复的指令块启用上下文缓存,其中大部分费用将降至缓存命中费率($0.014/1M),即约 $0.14。
- 输出:50,000 x 400 = 20M Token,费率为 $1.32/1M,即 $26.40。
总计:在峰值费率下每月大约为 $35 到 $40;如果批处理在工作日 UTC 时间 01:00 至 10:00 之外运行,费用大约减半。输出 Token 占了大头,这是一个非常有用的经验:由于图片输入如此便宜,你应该通过精简响应格式而不是缩小图片尺寸来优化视觉流水线。编写提示词以获取紧凑的 JSON 格式,而不是散文式的描述,这比任何图片预处理都能更有效地降低账单。
这种成本特征也是该模型改变 agent 循环成本考量的原因。对于旗舰级多模态模型来说,持续运行“截图-推理-行动”循环的成本太高,而在每帧只需 384 个 Token 的成本下,这一方案变得完全可行。
在 Apifox 中测试多模态请求
手动迭代视觉请求非常繁琐:base64 数据块会让原始 JSON 变得难以阅读,而对比不同的 detail 设置意味着需要处理几乎完全相同的 payload。一个更清爽的循环流程:
- 在 Apifox 项目中保存一次请求,并将
{{model_id}}、{{detail}}以及图片负载设为变量。这样,切换测试图片或 detail 级别就变成了简单的下拉框选择。 - 用脚本处理编码。 通过前置操作脚本读取图片并注入 base64 字符串,从而保持直观的请求 body 具有良好的可读性。
- 针对结构进行断言,而不是凭感觉。 如果你通过 prompt 要求输出 JSON(例如单项商品、边界框描述、图表数值),可以添加断言来解析响应并检查字段。这能将“模型看起来还行”的模糊感官转化为具体的通过/失败(pass/fail)结果,让你在每次 Exp 模型版本更新后都能重新运行。
- 为前端 mock 响应结构:在调整 prompt 的阶段,可以使用 Apifox 的智能 mock 功能来提供数据模型,而无需消耗实际的 API 调用次数。
免费下载 Apifox,几分钟即可完成整套搭建;当 DeepSeek 更新实验性模型时,只需一键即可重新运行。
FAQ
deepseek-v4-flash-vision-exp 是免费的吗? 不是,但也差不太多。它的计费标准与文本模型的 flash 费率完全一致,每张图片的输入上限为 384 个 Token。DeepSeek 的 Files API 图片存储是免费的,你只需在图片进入请求时付费。
它会取代 deepseek-v4-flash? 不会。文本模型仍然是稳定的 ID。视觉版本在文本任务上的表现与文本模型相当,因此如果你能接受实验性版本的频繁变动,可以将 ID 统一整合为视觉 ID,但更稳妥的做法是仅将包含图片的流量路由到视觉 ID。
我可以通过 Anthropic 风格的 API 格式来使用它吗? 可以。DeepSeek 的 V4 接口支持 Chat Completions、Messages 格式和 Responses 格式的调用,因此使用这三种风格中任何一种的现有客户端都可以直接添加图片块,而无需切换请求方言。我们的 V4 Pro API 教程展示了该系列共享的接口机制。
价格与 GPT 或 Claude 的视觉模型相比如何? 每百万输入 Token 仅需 $0.22 到 $0.44(包含 384 Token 的图片),比旗舰级多模态模型的费率低了一个数量级。唯一尚待验证的是在你的实际工作负载中的准确性,这也正是上述评估场景的意义所在。
总结
DeepSeek 依然在沿用他们一贯的打法:将大家都在收取高昂费用的功能,以极低的 flash 价格推出,并在其稳定之前予以诚实的标记。deepseek-v4-flash-vision-exp 让您能够以每张图片几分之一美分的成本,在生产环境接口上实现图像理解,并提供三种输入路径和可供设计考量的实际限制。在 Apifox 中构建一次请求,设置好你的断言,你不仅今天就能立即使用这个 Exp 模型,还能在它的继任者发布时第一时间对其进行评估。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会