DeepSeek 最便宜的模型现在也能“看图”了。2026 年 8 月 21 日,DeepSeek 发布了 deepseek-v4-flash-vision-exp:这是 V4-Flash 的视觉版本,可以通过同一个生产 API 接收图片,价格也与纯文本模型相同,并且每张图片最多只按 384 个输入 Token 计费。官方发布说明对此的表述很直接:具备与 V4-Flash 相同的文本能力,同时增加了图像理解能力;DeepSeek 称其多模态 Agent 性能已经接近 Opus 4.8。
本文将介绍这个模型是什么、名称中的“Exp”对生产环境意味着什么、发送图片的三种方式、实际使用中容易踩到的限制,以及如何正确测试多模态请求。由于视觉请求会混合多种内容类型,而且请求体很容易变大,因此与其在终端中手动编辑 JSON,不如在 Apifox 中构建这类 API 调用。
什么是 deepseek-v4-flash-vision-exp
这个模型是在 V4-Flash 上增加了图像编码器。DeepSeek 表示,它在包括 Agent 任务、推理和世界知识在内的文本任务上与基础模型保持一致,因此可以直接替换使用,而不会丢失 V4-Flash 原有的能力。OpenRouter 的模型信息将它描述为稀疏混合专家模型,总参数量为 284B,其中 13B 为激活参数。
需要了解的背景是:V4-Flash 是 DeepSeek 的经济型产品线。我们曾在 DeepSeek V4-Flash API 指南中介绍过它的文本模型,而它的价格体系并没有改变。按照 Flash 价格提供视觉能力,成本低于市面上几乎所有多模态 API;也正因为如此,DeepSeek 声称其“多模态 Agent 基准测试成绩接近 Opus 4.8”才引起了关注。厂商的基准测试结果应当被视为厂商声明;在迁移任何服务之前,请务必使用自己的文档进行评测。
尽管名称中带有 experimental 标识,但它并不是只能在沙箱中试用的玩具模型。该模型运行在生产 API 接口上,使用与其他 V4 模型相同的速率限制和 SLA,并且不需要等待名单或特殊的访问申请。
价格:图片也按 Flash 价格计费
根据 DeepSeek 的价格页面,该模型的价格表与纯文本模型 deepseek-v4-flash 完全相同:
| 非高峰期 | 高峰期 | |
|---|---|---|
| 输入,缓存命中(每 1M Token) | $0.007 | $0.014 |
| 输入,缓存未命中(每 1M Token) | $0.22 | $0.44 |
| 输出(每 1M Token) | $0.66 | $1.32 |
图片会被转换为 Token 用于计费,每张最多按 384 个 Token 计算,并按照输入价格收费。按照高峰期缓存未命中的价格计算,一张图片的最高成本约为 $0.00017。处理 1,000 张图片的费用还不到一杯咖啡的价格。
文本模型的两项计费特性同样适用于这里。非高峰期价格是高峰期的一半;工作日的高峰时段为 UTC 时间 01:00–04:00 和 06:00–10:00,因此在这些时段之外执行批量视觉任务,成本可以降低一半。上下文缓存也适用于重复输入:当你针对不同图片反复发送同一段 system prompt 时,这一点尤其重要。价格页面列出了 V4 系列 1M Token 的上下文窗口,但实际输出上限会低得多。
发送图片的三种方式
该模型通过 DeepSeek 标准的 Chat Completions 接口工作,接口地址为 https://api.deepseek.com/chat/completions。(正如 V4-Flash Responses API 发布说明中介绍的那样,它也支持 Messages 风格和 Responses 风格的请求。)图片需要放在用户消息的 content 数组中,共有三种传递方式。
1. Base64 内联数据。 将图片编码为 data URL。这种方式简单、请求自包含,但每张图片的大小上限为 32 MiB:
import base64
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
with open("invoice.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extract the line items and totals as JSON."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
]
}]
)
print(response.choices[0].message.content)
2. 外部 URL。 直接传入一个可以公开访问的链接(最长 8,192 个字符),无需进行编码:
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
3. Files API 引用。 先上传一次,后续通过 ID 重复使用。DeepSeek 的 Files API 现在可以免费接收图片上传;使用 file_id 引用后,就不必在多个请求中重复上传同一张图片,而且单张图片的大小上限更高,达到 64 MiB:
{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}
一次性调用使用 Base64,图片已经存放在 CDN 上时使用 URL;如果一个工作流会多次处理同一张图片,则使用 file ID。
detail 参数
每张图片都可以设置可选的 detail 字段,用于控制预处理方式:
"low":缩放到 512x512。成本最低、速度最快,适合分类级别的问题。"high"/"original":保留原始尺寸,适合内容密集的文档和小字号文本。"auto":由 API 自动决定。
在内部,图片会被归一化到大约 800x800,用于计算 Token,这也是每张图片的计费上限能够保持在 384 Token 的原因。如果你要处理收据或看板等接近 OCR 的任务,请在真实数据集上对比测试 "low" 和 "high";在当前价格下,两者的成本差异很小,但准确率差异可能很大。
上线前需要了解的限制
| 限制项 | 数值 |
|---|---|
| 单个请求最多图片数 | 600 |
| 内联(Base64)图片大小 | 32 MiB |
| Files API 图片大小 | 64 MiB |
| 请求体总大小 | 48 MiB |
| 图片尺寸 | 每边 8,192 像素(请求包含 15 张及以上图片时为 4,096 像素) |
| 外部 URL 长度 | 8,192 个字符 |
| 图片放置位置 | 仅限 user 消息 |
最后一项确实很容易触发 400 错误:如果将图片放在 system 或 assistant 消息中,请求会被拒绝。多图片请求受到支持,图片可以与文本自由交错;这正是该模型能够用于“截图、推理、执行”Agent 循环的原因。如果你正在编排这类循环,DeepSeek 在同一天发布的 DeepSeek Harness 0.1.1 已原生支持该模型。DeepSeek Harness 概览介绍了这套技术栈。还需要注意的是,视觉能力可以与工具调用一起使用,工作方式与文本模型在函数调用指南中介绍的流程相同。
HiFox:将 Agent 变成真正的队友
另外,我们也在思考,AI 如何从个人提效走进团队协作。
HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。
👉 立即体验 HiFox:https://hifox.com
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。