DeepSeek-V4-Pro 停用迁移指南:四天内完成模型切换与回归测试

DeepSeek 将于 9 月 14 日把 deepseek-v4-pro 请求静默改路由到 V4.1-Flash。本文梳理变更内容、迁移检查清单、价格与并发变化,并在 Apifox 中搭建 Pro 与 Flash 的回归测试集。

用 Apifox,节省研发团队的每一分钟

DeepSeek-V4-Pro 停用迁移指南:四天内完成模型切换与回归测试

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

DeepSeek 只给了 deepseek-v4-pro 用户四天时间。2026 年 9 月 14 日 04:00 UTC(北京时间 12:00)起,所有指定 deepseek-v4-pro 的请求都会被路由到 DeepSeek-V4.1-Flash,并按 V4.1-Flash 的价格计费。不会报错,也没有任何提示。你的账单变少了,但回答你 prompt 的已经换成了另一个模型。

最后一点才是需要提前规划的。发布说明把这次变更描述为一次升级,从 DeepSeek 自己公布的数据看确实如此。但“被静默改路由”和“已经过测试”是两回事。如果你的产品依赖某种特定的 tool call 结构,或者依赖你针对 V4-Pro 调优出来的延迟预算,那你应该在周日之前、而不是之后,知道到底有哪些变化。

本文涵盖 DeepSeek 公布了什么、如果你什么都不做会发生什么、迁移检查清单,以及如何在 Apifox 中搭建 Pro 与 Flash 的回归测试集,让这次切换平稳无事。关于模型本身,请先阅读 DeepSeek-V4.1-Flash 是什么。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

TL;DR

  • 切换时间:2026 年 9 月 14 日 04:00 UTC。从那一刻起,deepseek-v4-pro 的请求由 V4.1-Flash 处理。
  • 你的调用不会失败,也不会再按 Pro 的价格付费。高峰时段 cache miss 输入从每 1M tokens $1.32 降到 $0.30(降低 77%);输出从 $3.96 降到 $1.20(降低 70%)。
  • 自行把 model id 改成 deepseek-flash,然后重新测试 function calling、结构化输出、流式输出和 reasoning effort。
  • DeepSeek 表示 V4.1-Flash 在所有列出的 benchmark 上都优于 V4-Pro。这些是厂商自己的数据,请跑你自己的评测。

DeepSeek 在 9 月 10 日公布了什么

9 月 10 日的更新日志包含两件事:V4.1-Flash 在 API 上正式 GA,以及 V4-Pro 将在四天后停用。

关于 V4-Pro,措辞很直接。DeepSeek 称 V4.1-Flash“在性能、成本、速度和总耗时上已全面超越 V4 Pro”,并援引“多方测试”。从 9 月 14 日 04:00 UTC 起,发往 deepseek-v4-pro 的请求由 V4.1-Flash 提供服务,并按 V4.1-Flash 计费。不存在让 Pro 以旧名称继续运行的宽限期。

这次命名清理不止涉及 Pro:

模型名称 9 月 10 日之后的状态
deepseek-flash V4.1-Flash 的新规范 id
deepseek-v4-flash 仍可接受,由 V4.1-Flash 提供服务
deepseek-v4-flash-vision-exp 仍可接受,由 V4.1-Flash 提供服务
deepseek-v4-pro 在 9 月 14 日 04:00 UTC 之前由 V4-Pro 提供服务,之后改路由到 V4.1-Flash

V4-Flash 和 V4-Flash-Vision-Exp 作为模型已停用,只有名字作为别名继续存在。base URL 不变:OpenAI 兼容格式用 https://api.deepseek.com,Anthropic 兼容格式用 https://api.deepseek.com/anthropic。V4.1-Flash API 的用法指南详细介绍了新的 model id、reasoning 控制和图片输入。

如果什么都不做会发生什么

简短版:你的集成继续可用,而且更便宜。详细版:有五个变化会在你脚下发生。

换了一个模型来回答。V4.1-Flash 是一个 552B 参数的 MoE,采用新的 Causal Encoder-Decoder 结构:40 层,20 层 encoder 加 20 层 decoder,prefill 阶段激活 8B 参数,decode 阶段激活 16B。你的 prompt 现在面对的是不同的激活参数预算和不同的注意力设计(Compressed Sparse Attention 2)。可以预期措辞不同、默认详细程度不同,有时在边界情况的 tool call 上判断也会不同。

输出上限相同,推荐设置不同。两个模型都标称 1M 上下文和 384K 最大输出。V4.1-Flash 的 model card 推荐 temperature 1.0、top_p 0.95 或 1.0,以及 256K 或更大的 max tokens。如果你之前在 V4-Pro 上设置了很小的 max_tokens 来控制成本,请检查 reasoning 输出现在是否会在最终答案到来之前就被截断。

Reasoning effort 使用不同的量纲。DeepSeek 把 V4.1-Flash 的 reasoning effort 描述为 1 到 100 的“连续可调”标度。V4-Flash 接受 reasoning_effort 加上 extra_body={"thinking": {"type": "enabled"}}。这个 1 到 100 的标度如何映射到 API parameter,需要对照当前文档 [VERIFY];不要假设像 "high" 这样的命名档位仍代表它在 Pro 上的深度。

价格向有利方向变化,但有高峰时段。高峰时段为周一至周五 01:00–04:00 和 06:00–10:00 UTC。非高峰价格是高峰的一半。被改路由的 Pro 流量在两个时段都按 Flash 价格计费。

并发余量大幅提升。V4-Pro 的限制是 500 个并发请求,Flash 是 2,500 个。被改路由的流量继承更高的限制,所以请重新审视任何针对 500 调优的客户端退避策略。

迁移检查清单

按顺序执行。它们合起来能把一次静默改路由变成一次有意的发布。

  1. 重命名 model id。在代码库和配置中搜索 deepseek-v4-pro,替换为 deepseek-flash。即使别名仍然可以解析,也要这样做:显式的 id 让日后排查故障更容易读懂。
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",  # was "deepseek-v4-pro"
    messages=[
        {"role": "system", "content": "You triage support tickets. Return a JSON object with priority, team, and summary."},
        {"role": "user", "content": "Customer reports checkout returns 502 after applying a discount code."},
    ],
    response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
  1. 检查 reasoning effort 设置。列出所有设置 reasoning_effort 或 thinking 开关的地方。逐接口决定你要的是深度还是延迟,然后针对新的标度逐个测试,而不是直接把旧值搬过去。
  2. 重新运行 function calling 和结构化输出测试。tool call 参数的格式是换模型时最容易出问题的地方。如果你在 V4-Pro 上搭建 function calling 时写过测试,现在就针对 deepseek-flash 跑一遍。如果没写过,下面的 Apifox 工作流可以给你一套。
  3. 检查流式解析器。在 thinking 模式下,V4.1-Flash 会把 reasoning delta 和 answer delta 分开流式返回。确认你的 SSE 处理逻辑没有把它们拼接在一起,并确认你的“首 token”计时器测的确实是你以为的东西。
  4. 重新确立延迟和成本的基线。本周记录 V4-Pro 的 p50、p95 延迟以及每次请求的 token 数,然后对 deepseek-flash 记录同样的数据。当有人问起周一仪表盘为什么变了时,你会同时需要这两组数字。
  5. 更新仪表盘和预算。按高峰输出 $3.96 校准的成本告警,在你只付 $1.20 之后就不会再触发,而一个永不触发的预算等于没人看。把阈值重置为价格页上的费率,并修正任何按旧 id 过滤的按模型拆分。

如果你调用的是 Anthropic 兼容格式或 Responses API 格式而不是 chat completions,同样适用这些步骤;V4-Pro API 格式对比展示了每种请求的样子,方便你对应字段。

V4-Pro 与 V4.1-Flash 速览

benchmark 数据来自 DeepSeek 自己公布,出处是 V4.1-Flash model card。价格为每 1M tokens 的美元价,2026 年 9 月 10 日起生效。

deepseek-v4-pro deepseek-flash (V4.1)
激活参数 V4.1 的 model card 未重申 8B prefill / 16B decode
HumanEval 76.8 79.4
GSM8K 92.6 93.0
DeepSWE v1.1 62.7 74.2
Terminal-Bench 2.1 87.9 90.6
输入,cache hit(非高峰 / 高峰) $0.022 / $0.044 $0.003 / $0.006
输入,cache miss(非高峰 / 高峰) $0.66 / $1.32 $0.15 / $0.30
输出(非高峰 / 高峰) $1.98 / $3.96 $0.60 / $1.20
上下文 / 最大输出 1M / 384K 1M / 384K
并发限制 500 2,500

差距最大的是 DeepSWE,提升 11.5 分;最小的是 GSM8K,提升 0.4 分。如果你的负载接近小学算术,可以预期两者持平;如果接近多文件代码编辑,按 DeepSeek 的数据你会获得提升。包含 V4-Flash 的三方对比见 V4.1-Flash vs V4-Pro vs V4-Flash。

风险:厂商 benchmark 衡量的是厂商的任务

表格中的每一个数字都来自 DeepSeek。“多方测试”是 DeepSeek 的说法,而发布说明里没有点名这些方是谁。这并不说明数字是错的,只是说明它们是在 benchmark 套件上测出来的,而不是在你的 prompt、你的 tool schema 或你用户那些杂乱的输入上测出来的。

一个模型可以在 Terminal-Bench 上得分更高,但同时也改变它格式化 tool call 参数的方式,而你的解析器正依赖那种格式。如果模型写出的内容多了一倍,那么输出 token 更便宜也帮不上忙。唯一的办法是在两个模型都还在的时候,把你的真实流量同时跑过它们。你只有到 9 月 14 日为止。

在切换前用 Apifox 搭建回归测试集

下面是一个 Apifox 工作流,可以给你可重复的 Pro 与 Flash 对比,并把运行交给 CI。

  1. 导入现有的 V4-Pro 请求。导入一份 OpenAI 兼容的 OpenAPI 规范,或者直接粘贴你在生产环境使用的 curl 命令。把 DEEPSEEK_API_KEY 放进环境,并在 Authorization header 中以 Bearer {{DEEPSEEK_API_KEY}} 引用它。再加一个变量 {{MODEL_ID}},设为 deepseek-v4-pro。
  2. 为每个请求复制一份改用 deepseek-flash 的版本。在第二个环境中把 {{MODEL_ID}} 设为 deepseek-flash,或者在一对请求里把两个 id 写死。相同的 prompt、相同的 tools 数组、相同的 max_tokens。唯一的差别应该是模型。
  3. 对 JSON 结构和 tool call 结构添加断言。对结构化输出,断言 choices[0].message.content 能被解析为 JSON 且包含你期望的 key。对 function calling,断言 choices[0].message.tool_calls[0].function.name 等于你期望的 tool,且 arguments 能被解析。这些检查能捕捉静默的格式漂移。
  4. 把两者作为一个测试场景运行。把 Pro 和 Flash 的请求串成单个场景,这样每次运行只产出一份报告。加入一个带 stream: true 的流式请求;Apifox 会逐条渲染 SSE 事件,这样你能看到 reasoning delta 和 answer delta 是否按你解析器期望的方式到达。
  5. 对比结果。比较报告的两半:断言通过率、响应时间和 usage.completion_tokens。一个通过所有断言但多输出 40% token 的模型会改变你的成本计算,而你会在账单之前先看到这一点。
  6. 用 apidog-cli 在 CI 中定时运行。从你的流水线中每天运行该场景,持续到 9 月 14 日,之后继续保留。Pro 停用后,Pro 那一半也返回 Flash 的响应,差异会归零:这就确认了切换已经发生,而你的断言依然成立。

常见问题

9 月 14 日我的 V4-Pro 调用会失败吗?不会。指定 deepseek-v4-pro 的请求会被改路由到 V4.1-Flash。你会收到 200 响应和一个 V4.1-Flash 的回答。失败模式是行为上的,而不是错误码。

切换后还会按 V4-Pro 的价格计费吗?不会。被改路由的请求按 V4.1-Flash 的费率计费:高峰时段每 1M cache miss 输入 token 为 $0.30 而非 $1.32,每 1M 输出 token 为 $1.20 而非 $3.96。

我应该把 id 改成 deepseek-flash,还是保留 deepseek-v4-pro?改名。别名能用,但显式的 id 能让你的日志、仪表盘和成本报告如实反映真正被调用的东西。

V4-Pro-0813 的那套配置还适用吗?V4-Pro-0813 API 指南中的 key、base URL 和请求结构都原样沿用。变化的是它们背后的模型以及 reasoning-effort 控制,所以要重新测试,而不是想当然。

V4.1-Flash 有哪方面不如 V4-Pro 吗?DeepSeek 公布的 benchmark 显示每一项列出的任务都有提升。发布时没有可用的第三方独立结果。把“没有任何方面更差”当作一个待验证的说法。

四天足够了

这次迁移就是改一个字符串加跑一次测试。改字符串只要一分钟。跑测试能告诉你,下周你要付费的那个模型是否还像你当初据以设计的那一个。搭好测试集,趁 deepseek-v4-pro 仍然解析到 Pro 的时候跑一遍,然后看差异。如果差异干净,你就免费拿到便宜 70% 的账单和五倍的并发。如果不干净,你是在自己的时间表上发现的,而不是 DeepSeek 的。

HiFox :将 Agent 变成真正的队友

另外,我们也在思考,AI 如何从个人提效走进团队协作。

HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。

👉 立即体验 Hifox:https://hifox.com

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。