如何使用 DeepSeek V4-Flash-Vision API(图像输入指南)

本文介绍 DeepSeek V4-Flash-Vision API 的图片输入方式、计费规则、使用限制与多模态请求测试方法。

用 Apifox,节省研发团队的每一分钟

如何使用 DeepSeek V4-Flash-Vision API(图像输入指南)

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

DeepSeek 最便宜的模型现在也能“看图”了。2026 年 8 月 21 日,DeepSeek 发布了 deepseek-v4-flash-vision-exp:这是 V4-Flash 的视觉版本,可以通过同一个生产 API 接收图片,价格也与纯文本模型相同,并且每张图片最多只按 384 个输入 Token 计费。官方发布说明对此的表述很直接:具备与 V4-Flash 相同的文本能力,同时增加了图像理解能力;DeepSeek 称其多模态 Agent 性能已经接近 Opus 4.8。

本文将介绍这个模型是什么、名称中的“Exp”对生产环境意味着什么、发送图片的三种方式、实际使用中容易踩到的限制,以及如何正确测试多模态请求。由于视觉请求会混合多种内容类型,而且请求体很容易变大,因此与其在终端中手动编辑 JSON,不如在 Apifox 中构建这类 API 调用。

什么是 deepseek-v4-flash-vision-exp

这个模型是在 V4-Flash 上增加了图像编码器。DeepSeek 表示,它在包括 Agent 任务、推理和世界知识在内的文本任务上与基础模型保持一致,因此可以直接替换使用,而不会丢失 V4-Flash 原有的能力。OpenRouter 的模型信息将它描述为稀疏混合专家模型,总参数量为 284B,其中 13B 为激活参数。

需要了解的背景是:V4-Flash 是 DeepSeek 的经济型产品线。我们曾在 DeepSeek V4-Flash API 指南中介绍过它的文本模型,而它的价格体系并没有改变。按照 Flash 价格提供视觉能力,成本低于市面上几乎所有多模态 API;也正因为如此,DeepSeek 声称其“多模态 Agent 基准测试成绩接近 Opus 4.8”才引起了关注。厂商的基准测试结果应当被视为厂商声明;在迁移任何服务之前,请务必使用自己的文档进行评测。

尽管名称中带有 experimental 标识,但它并不是只能在沙箱中试用的玩具模型。该模型运行在生产 API 接口上,使用与其他 V4 模型相同的速率限制和 SLA,并且不需要等待名单或特殊的访问申请。

价格:图片也按 Flash 价格计费

根据 DeepSeek 的价格页面,该模型的价格表与纯文本模型 deepseek-v4-flash 完全相同:

非高峰期 高峰期
输入,缓存命中(每 1M Token) $0.007 $0.014
输入,缓存未命中(每 1M Token) $0.22 $0.44
输出(每 1M Token) $0.66 $1.32

图片会被转换为 Token 用于计费,每张最多按 384 个 Token 计算,并按照输入价格收费。按照高峰期缓存未命中的价格计算,一张图片的最高成本约为 $0.00017。处理 1,000 张图片的费用还不到一杯咖啡的价格。

文本模型的两项计费特性同样适用于这里。非高峰期价格是高峰期的一半;工作日的高峰时段为 UTC 时间 01:00–04:00 和 06:00–10:00,因此在这些时段之外执行批量视觉任务,成本可以降低一半。上下文缓存也适用于重复输入:当你针对不同图片反复发送同一段 system prompt 时,这一点尤其重要。价格页面列出了 V4 系列 1M Token 的上下文窗口,但实际输出上限会低得多。

发送图片的三种方式

该模型通过 DeepSeek 标准的 Chat Completions 接口工作,接口地址为 https://api.deepseek.com/chat/completions。(正如 V4-Flash Responses API 发布说明中介绍的那样,它也支持 Messages 风格和 Responses 风格的请求。)图片需要放在用户消息的 content 数组中,共有三种传递方式。

1. Base64 内联数据。 将图片编码为 data URL。这种方式简单、请求自包含,但每张图片的大小上限为 32 MiB:

import base64
from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")

with open("invoice.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extract the line items and totals as JSON."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
        ]
    }]
)
print(response.choices[0].message.content)

2. 外部 URL。 直接传入一个可以公开访问的链接(最长 8,192 个字符),无需进行编码:

{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}

3. Files API 引用。 先上传一次,后续通过 ID 重复使用。DeepSeek 的 Files API 现在可以免费接收图片上传;使用 file_id 引用后,就不必在多个请求中重复上传同一张图片,而且单张图片的大小上限更高,达到 64 MiB:

{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}

一次性调用使用 Base64,图片已经存放在 CDN 上时使用 URL;如果一个工作流会多次处理同一张图片,则使用 file ID。

detail 参数

每张图片都可以设置可选的 detail 字段,用于控制预处理方式:

  • "low":缩放到 512x512。成本最低、速度最快,适合分类级别的问题。
  • "high" / "original":保留原始尺寸,适合内容密集的文档和小字号文本。
  • "auto":由 API 自动决定。

在内部,图片会被归一化到大约 800x800,用于计算 Token,这也是每张图片的计费上限能够保持在 384 Token 的原因。如果你要处理收据或看板等接近 OCR 的任务,请在真实数据集上对比测试 "low" 和 "high";在当前价格下,两者的成本差异很小,但准确率差异可能很大。

上线前需要了解的限制

限制项 数值
单个请求最多图片数 600
内联(Base64)图片大小 32 MiB
Files API 图片大小 64 MiB
请求体总大小 48 MiB
图片尺寸 每边 8,192 像素(请求包含 15 张及以上图片时为 4,096 像素)
外部 URL 长度 8,192 个字符
图片放置位置 仅限 user 消息

最后一项确实很容易触发 400 错误:如果将图片放在 system 或 assistant 消息中,请求会被拒绝。多图片请求受到支持,图片可以与文本自由交错;这正是该模型能够用于“截图、推理、执行”Agent 循环的原因。如果你正在编排这类循环,DeepSeek 在同一天发布的 DeepSeek Harness 0.1.1 已原生支持该模型。DeepSeek Harness 概览介绍了这套技术栈。还需要注意的是,视觉能力可以与工具调用一起使用,工作方式与文本模型在函数调用指南中介绍的流程相同。


HiFox:将 Agent 变成真正的队友

另外,我们也在思考,AI 如何从个人提效走进团队协作。

HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。

👉 立即体验 HiFox:https://hifox.com

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

AI Coding 交流群