DeepSeek V4 Pro 于 2026 年 8 月 12 日结束预览。标记为 0813 的 GA 版本目前正为 deepseek-v4-pro API 接口提供支持,它带来了一组令人难以置信的数据:1M Token 的上下文窗口、最高 384K Token 的输出,以及在缓存命中时低至每百万 Token 0.003625 美元的输入价格。正如 Unite.AI 报道的那样,这款经历了四个月预览期的模型现在已成为 DeepSeek 的旗舰模型。
发布报道只告诉了你更新了什么,却没有告诉你如何调用它。本指南侧重于实操部分:使用 OpenAI SDK 发送首次请求、思考模式和 reasoning_content 字段、流式传输、工具调用,以及决定这 1M 上下文究竟是物美价廉还是昂贵无比的 prompt 缓存机制。如果你想先了解架构背景,可以阅读《What is DeepSeek V4》然后再回来。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
TL;DR
- DeepSeek-V4-Pro-0813 是截至 2026 年 8 月 12 日
deepseek-v4-pro接口背后的 GA 快照版本,也是生产环境中应指定的目标版本。 - 该 API 兼容 OpenAI:将
openaiSDK 指向https://api.deepseek.com,设置model="deepseek-v4-pro"即可。同时它也支持 Anthropic Messages 格式以及 DeepSeek 自有的响应 API。 - 提供 1M Token 上下文、384K 最大输出,以及三种思考模式(
non-think、think high、think max),并在返回答案的同时返回reasoning_content字段。 - 价格:输入 $0.435/百万 Token(缓存未命中),输入 $0.003625/百万 Token(缓存命中,便宜 120 倍),输出 $0.87/百万 Token。当 prompt 前缀重复时,会自动触发缓存。
- DeepSeek 于 8 月 6 日发出预警,称 API 价格将迎来“显著”上涨。目前尚未公布具体数字或日期,因此在做预算时请预留一定空间。
- 在将其接入实际业务之前,可以在 Apifox 中测试接口、检查 SSE 流,并将 pro/flash 环境并排进行对比。
GA 0813 版本为开发者带来了哪些变化
该预览版于 2026 年 4 月开启,更轻量级的兄弟模型 V4 Flash 于 7 月发布,而 Pro 模型于 8 月 12 日正式步入 GA 阶段(版本号为 0813),这延续了 DeepSeek 惯用的日期戳命名规则(正如 v3-0324 代表 V3 的快照版本一样)。

GA 版本带来了三个核心变化:
- 快照更加稳定。预览版模型可能会暗中发生变化,从而使评估和 prompt 微调(prompt tuning)失效。在 DeepSeek 宣布新的快照之前,0813 版本是一个固定不变的目标。
- 该接口是生产环境的别名。在官方 API 上,你只需调用
deepseek-v4-pro即可接入 0813 版本;如果需要显式锁定该快照,OpenRouter 将其列为deepseek/deepseek-v4-pro-0813。 - 完整的功能特性已全部开启。思考模式、函数调用(function calling)、结构化输出、prompt 缓存,以及多格式 API(OpenAI、Anthropic、响应)目前都已在 GA 接口上线。
在底层,V4 Pro 是一款混合专家模型,拥有 1.6T 总参数,每个 token 的激活参数为 49B。其核心的工程亮点在于效率:Compressed Sparse Attention(压缩稀疏注意力)和 Heavily Compressed Attention(重度压缩注意力)这两种注意力机制,将单 token 推理计算量降低至 V3.2 的 27%,而 KV cache 则减少至 10%。正是 KV cache 的大幅减少,才使得 1M token 的上下文在如此低廉的价格下成为可实用的服务,而不仅仅是一个用于演示的功能。
DeepSeek V4 Pro 0813:规格一览
| 规格 | DeepSeek V4 Pro 0813 |
|---|---|
| 发布时间 | 2026 年 8 月 12 日正式商用 (GA)(快照版本 0813) |
| 架构 | 混合专家模型,1.6T 总参数,每个 token 激活参数为 49B |
| 注意力机制 | Compressed Sparse Attention + Heavily Compressed Attention |
| 相比 V3.2 的推理成本 | 单 token 计算量仅为 27%,KV cache 仅为 10% |
| 上下文窗口 | 1,000,000 token |
| 最大输出 | 384K token |
| 思考模式 | non-think, think high, think max |
| 输入价格 | $0.435/百万 token(缓存未命中),$0.003625/百万(缓存命中) |
| 输出价格 | $0.87/百万 token |
| API 格式 | OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses |
| 模型 ID | deepseek-v4-pro |
| 同系列轻量模型 | deepseek-v4-flash(284B 总参数 / 13B 激活),输入 $0.14/百万,输出 $0.28/百万 |
在能力方面,根据 DeepSeek 官方的模型卡片,其最高思考配置 V4-Pro-Max 在各基准测试中的表现如下:SWE-bench Verified 为 80.6%,Terminal Bench 2.0 为 67.9%,GPQA Diamond 为 90.1%,LiveCodeBench 为 93.5%。这些是厂商自行公布的数据,尚未经过第三方验证,因此在迁移任何重要业务之前,请针对您自己的特定任务进行评估。
获取 API Key 并发送你的第一个请求
设置过程大约需要五分钟:
- 在 DeepSeek 平台(platform.deepseek.com)创建账户并充值,该 API 为预付费模式。
- 打开 API Keys 页面,生成一个 Key,并立即复制(它仅显示一次)。
- 将其导出为环境变量,而不是直接粘贴到代码中:
export DEEPSEEK_API_KEY="sk-..."
该 API 兼容 OpenAI Chat Completions 协议,因此可以使用标准的 openai 包作为客户端。https://api.deepseek.com 和 https://api.deepseek.com/v1 都可以作为前置 URL;其中 /v1 是为了协议兼容性,而非模型版本。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "You are a concise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
],
)
print(response.choices[0].message.content)
print(response.usage)
从第一天起就建议打印 response.usage。对于一个缓存命中时极其便宜,而 1M token 缓存未命中时却非常昂贵的模型来说,做好 token 统计决定了你的账单是仅仅可以忽略不计的零头,还是一笔实实在在的开销。
以下是基于原始 HTTP 发送的相同请求,适用于冒烟测试或导入至 API 工具中:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "List three ways to version a REST API."}
]
}'完整的参数参考请见官方 DeepSeek 文档,其中包括兼容 Anthropic 的接口(无需重写任何代码即可在 Anthropic SDK 和 Claude Code 中使用)以及 DeepSeek 自身的 Responses API。
使用三种思考模式
V4 Pro 将推理能力作为可调参数提供,而不是将其作为一个单独的模型。一个接口,三种模式:
- non-think:模型直接回答。速度最快且成本最低,适用于数据提取、分类、格式化和摘要。
- think high:模型在回答前进行推理,并在
reasoning_content字段中返回该推理过程。这是编写代码、调试和多步骤分析的默认设置。 - think max:最大推理预算,即 V4-Pro-Max 基准测试数据背后的配置。请将其留给真正困难的问题。
这些模式映射到标准的 reasoning_effort parameter,因此无需编写特定厂商的对接代码:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{"role": "user", "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability."},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)两个实用注意事项。第一,切勿将 reasoning_content 传回对话历史记录中;仅发送历史轮次中的 content。第二,推理 token 的计费方式与输出 token 相同,价格为 $0.87/百万 token,因此 think max 会产生真实的资金成本和明显的延迟。请根据具体任务匹配合适的模式,而不是默认使用最大化模式。
流式响应
鉴于最大输出达到 384K 且思考模式可以进行长时间的推理,非流式请求会导致较差的用户体验。请设置 stream=True 并处理两种类型的 delta。在思考模式下,reasoning_content 数据块会先到达,然后才是回答内容:
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{"role": "user", "content": "Design a rate limiter for a public API. Compare token bucket and sliding window."},
],
)
for chunk in stream:
if not chunk.choices:
continue # final chunk may carry usage data only
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True) # thinking phase
elif delta.content:
print(delta.content, end="", flush=True) # answer phase
一种合理的 UI 模式:在“思考”状态下折叠渲染推理阶段,当 content 增量(deltas)开始输出时再切换回正常渲染。在底层,这是标准的服务器发送事件(SSE);我们关于使用 SSE 流式传输 API 响应的指南介绍了其具体工作原理。
工具调用与结构化输出
V4 Pro 支持 OpenAI 风格的函数调用,这意味着现有的 Agent 循环无需修改即可直接迁移。定义工具、读取 tool_calls、执行、追加结果并重复:
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {"type": "string", "description": "Path, e.g. /v1/orders"}
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Is /v1/orders healthy right now?"}],
tools=tools,
)
print(response.choices[0].message.tool_calls)
当你你需要保证输出可解析的 JSON 时,可以通过标准的 response_format parameter 来使用结构化输出。多步骤工具循环的完整演练值得写一篇专门的文章;官方文档中介绍了消息结构的详细信息。
Prompt 缓存经济学:改变你架构的关键数字
以下是比基准测试更值得关注的指标。DeepSeek 会自动缓存 Prompt 前缀,无需设置 cache-control headers,也无需配置 TTL,重复前缀的计费仅为 $0.003625/百万 token,而不是 $0.435/百万 token。对于 API 已经接收过的输入,这相当于提供了 120 倍的优惠。
让我们根据实际的工作负载来算一笔账。假设你正在构建一个编码 Agent,它包含一个 20 万 token 的代码仓库上下文,并在一个会话中进行了 50 次调用:
- 无缓存时:50 次调用 × 20 万 token × $0.435/百万 token ≈ $4.35 的输入成本。
- 启用自动缓存时:1 次缓存未命中($0.087)+ 49 次缓存命中(每次约 $0.0007)≈ $0.12。
同样的会话,成本降低了约 35 倍,而实现这一效果只需合理安排 Prompt 结构:将稳定内容放在前面(系统提示词、文档、仓库上下文),将易变内容放在后面(用户的最新消息、时间戳、请求 ID)。Prompt 前部的任何变动都会导致该位置之后的缓存前缀失效,因此,如果在系统提示词中加入时间戳,就会无形中让每次调用都变成全额收费的缓存未命中。
这也重新定义了 100 万 token 上下文窗口的意义:未命中时填满它的成本是 $0.435,但如果作为稳定的会话前缀,每次调用的读取成本仅约三分之一美分。关于其通用原理,请参阅《什么是 Prompt 缓存》。
在 Apifox 中测试 deepseek-v4-pro
在将 V4 Pro 应用于生产环境代码之前,建议先在合适的调试工具中测试该接口。由于 DeepSeek 的 API 与 OpenAI 兼容,Apifox 无需任何特殊处理即可直接支持:

- 导入接口。将之前的 curl 命令粘贴到 Apifox 中,它就会转换成一个可编辑的请求,系统会自动解析其中的 header、auth 和 body。
- 为 Pro 和 Flash 设置环境。将
base_url和你的 API key 保存为环境变量,并将模型名称也设为变量。在deepseek-v4-pro和deepseek-v4-flash之间切换变成了只需一键切换环境的操作。这使得“在这个 prompt 上 Pro 是否值得花 Flash 三倍的价格?”成为一个实证问题,而不再是空口争论。 - 检查 SSE 流。发送带有
"stream": true的请求,Apifox 会将事件流渲染为实时的可视化时间线,而不是一堆杂乱的原始data:数据行,并通过合并 delta 让你能够看到reasoning_content在最终回答之前生成。当 think-max 调用感觉很慢时,此视图可以准确地向你展示时间都花在了哪里。 - 将会话保存为集合。当 DeepSeek 发布下一个快照时,在升级之前重新运行相同的请求并比对行为差异,这与团队通常在兼容 OpenAI 的接口上所使用的 workflow 一致。
响应查看器还会为每个请求显示 usage 块,这是你在调整 prompt 结构时验证缓存命中率最快的方法。
常见问题
我现有的 OpenAI SDK 代码能不做修改直接运行吗?
几乎可以。只需将 base_url 更改为 https://api.deepseek.com,替换 API key,并设置 model="deepseek-v4-pro" 即可。Chat Completions、流式传输、tools 和结构化输出都遵循 OpenAI 的格式规范。使用 Anthropic SDK 的团队也可以改用 DeepSeek 的 Anthropic Messages 接口。
什么时候我该选择 V4 Flash 而不是 V4 Pro?
Flash (总参数 284B,激活参数 13B) 是一款走量模型:适用于分类、提取、简单对话,以及任何对延迟敏感且不需要深度推理的任务。Pro 版则在 Agent 编程、长上下文分析和思考模式工作负载中,凭借其表现证明了其 3 倍输出价格的合理性。请根据具体任务进行路由分流,而不是出于对单一模型的忠诚度。
我可以在 Cursor 中使用 V4 Pro 0813 吗?
是的,Cursor 支持自定义兼容 OpenAI 的接口,因此 GA 版本可以直接作为自定义模型接入。我们在《如何在 Cursor 中使用 DeepSeek V4 Pro》中详细介绍了具体的配置步骤。
总结
在 GA 模型上线的第一天,正是建立以下肌肉记忆的最佳时机:配置 Key、发送首次请求、选择思考模式、启用流式传输,以及采用缓存感知的 prompt 布局。V4 Pro 比以往任何模型都更能回馈最后这一个习惯——120 倍的缓存折扣让 prompt 结构设计上升到了架构决策的高度。运行上述示例,观察 usage 的数值,并保存好 Apifox 集合,以便在下一个快照版本发布或公布的价格变更落地时,重新验证其行为。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会