阿里巴巴在 2026 年 8 月初发布了 Qwen 3.8-Max,如果你已经在生产环境中运行 qwen3.7-max,那么你现在面临着一个真正的抉择。新模型在 Agent(智能体)和研究基准测试上取得了显著的进步,新增了图像输入支持,首发定价更低,并带来了阿里巴巴从未对前代模型许下的承诺:开源权重。
但这一决定并非简单的“买新不买旧”。Qwen 3.7-Max 目前正在进行限时 5 折优惠,这使得它在绝对价格上比 3.8-Max 更便宜。一些基准测试的差距非常显著,而另一些则几乎为零。本文将详细梳理每一项关键变化,帮助你决定是立即切换、继续等待,还是彻底降级到更低的档次。
如果你想先全面了解新模型,可以从我们的 Qwen 3.8-Max 解析文章开始。要了解即将退役的旗舰模型的背景信息,请参阅 Qwen 3.7 带来了哪些特性。
在看数据之前,先对测试方法做个说明。以下所有基准测试数据均来自阿里巴巴官方 Qwen 3.8 发布博客中的表格。这在当前情况下其实很有参考价值:两个模型都是在厂商的同一次测试运行中进行评估的,因此即使仍有待独立第三方验证,其差值在内部也是一致的。大多数代码相关的测试都是在 Claude Code 测试框架上运行的,还有几个基准测试是 Qwen 内部自研的。
简要对比
| 对比项 | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
| IFBench | 79.1 | 82.8 |
| GPQA Diamond | 92.4 | 92.6 |
| HLE | 41.4 | 43.6 |
| 官方定价(每 100 万 token) | 输入 $2.5 / 输出 $7.5 | 输入 $2 / 输出 $6 |
| 当前价格(促销优惠) | 输入 $1.25 / 输出 $3.75 | 输入 $2 / 输出 $6 |
| 图像输入 | 无 | 有 |
| 已公布的架构 | 未公布 | 总参数 2.4T,激活参数 95B MoE |
| 开源权重 | 从未发布 | 承诺“下周”(约 8 月 10 日) |
| 上下文窗口 | 1M token | 1M token |
接下来是详细内容。
基准测试差距:真正提升的领域
备受瞩目的改进主要集中在 Agent 任务上:即模型需要进行规划、执行和自我纠正的长期任务。

Terminal Bench 2.1:74.5 提升至 86.6。 在终端驱动的 Agent 任务中,这实现了 12 分的巨大跨越,使 Qwen 从明显的落后状态提升到了真正具有竞争力的水平。在同一张表格中,阿里巴巴给 Claude Opus 4.8 和 Fable 5 的评分都是 84.6,这使得 3.8-Max 在这一项上超越了这两者。不过 GPT-5.6 Sol 仍以 88.8 的高分保持领先。
SWE-bench Pro:60.6 提升至 67.7。 在真实世界的软件工程任务上提升了 7 分。这项提升很有意义,但客观地说:在同一张表中,Fable 5 的得分是 80.0,因此这只能算是追赶,而非超越。如果 SWE-bench Pro 的性能是你的首要考量指标,那么业界最前沿的模型依然在别处。
PaperBench:64.8 到 93.0。 表格中单项增幅最大的一项,在复现 AI 研究论文方面实现了 28 分的飞跃。这也是 3.8-Max 表现最好的旗舰级指标,领先于阿里巴巴对比测试中的所有竞争对手。如果您的工作负载涉及研究复现、长篇技术文档或多步骤科学推理,那么这个数字绝对值得您关注。
IFBench:79.1 到 82.8。 指令遵循能力提升了近 4 分。值得注意的是,3.7-Max 在这方面的表现已经非常强劲(在同一次运行中以 79.1 分击败了 Opus 4.8 和 Fable 5),因此这次提升是扩大了既有优势,而非弥补短板。
GPQA Diamond:92.4 到 92.6。 基本持平。对于 3.7-Max 而言,研究生级别的科学问答(QA)已经接近饱和,新模型并没有带来明显的提升。如果您的工作负载类似于 GPQA,那么这次升级在质量上不会为您带来任何收益。
HLE:41.4 到 43.6。 Humanity’s Last Exam 提升了 2 分,但依然落后于行业前沿:在同一张表格中,Fable 5 达到了 53.3 分,GPT-5.6 Sol 达到了 47.2 分。Qwen 3.8-Max 在许多方面都缩小了差距,但这里显然不在此列。
规律显而易见:在 Agent 类和研究类基准测试中提升巨大,在指令遵循方面小幅提升,在已饱和的知识类基准测试中停滞不前,而在最难的推理评估上依然存在差距。要深入了解完整表格,包括关于评估框架(harnesses)和内部基准测试的细节,请参阅我们的 Qwen 3.8 基准测试拆解分析。
架构:阿里巴巴终于公布了其数据
Qwen 3.8-Max 是一款拥有 2.4 万亿参数的混合专家(MoE)模型,每次前向传播有 95B 激活参数,基于 Qwen 3.5 架构基础构建。这相当于约 4% 的激活率,这对于服务成本至关重要:你只需为 95B 的计算付费,而不是 2.4T。
与 3.7-Max 的对比在于信息披露本身。阿里巴巴从未公布过 Qwen 3.7-Max 类似的模型规模数据。参数量、激活率、专家配置:全部未公开。而在 3.8-Max 中,Model Studio 模型文档和发布公告详细阐述了其架构,这使得容量规划和成本建模不再像以前那样完全靠猜测。
作为开源权重竞争的背景参考:Kimi K3 总参数量为 2.8T,激活参数量为 104B。Qwen 3.8-Max 在这两个维度上都更小一些。
多模态:3.7-Max 从未拥有的能力
Qwen 3.7-Max 是一个纯文本模型。而 Qwen 3.8-Max 原生支持图像输入,且阿里巴巴发布了一张独立的多模态基准测试表,在与 Gemini 3.1 Pro 和 GPT-5.6 Sol 的对比中,它在大多数指标上都处于领先地位。
阿里巴巴多模态测试表中的亮眼数据包括:MathVision 达到 95.2,LogicVista 达到 91.9,以及在计算机使用任务上的 OSWorld-Verified 达到 86.1。该表格中没有用于对比的 3.7-Max 列,因为这根本不可能:旧模型不支持图像输入。
在实际应用中,这意味着你以前必须路由到独立视觉模型的任务负载(如屏幕截图理解、文档图像、UI 自动化、图表提取),现在可以在与你的文本流量相同的模型 ID 上运行。发布日志中还展示了长文档和视频理解能力,不过这些是博客中演示的功能,而不是不同的 API 输入类型,因此请针对你的具体情况核对接口文档。
价格:新模型更便宜,但目前除外
在这里,升级的成本计算变得有趣起来。
Qwen 3.8-Max 的首发价格为每 1M tokens 输入 $2 / 输出 $6,在整个 1M 上下文区间内采用统一的单一计费档位。Qwen 3.7-Max 的官方定价为 $2.5 / $7.5。因此,这款功能更强的新模型比其前代产品的官方定价便宜了 20%。这在旗舰模型的世代更迭中几乎前所未有。
但这里有个插曲:阿里巴巴目前正在对 3.7-Max 进行限时 5 折促销,这使其实际费率降至 $1.25 / $3.75。按当前的价格来看,旧模型比新模型便宜 38%。所有费率均已公布在 Model Studio 官方定价页面。
需要注意以下两点:
- 促销可能会结束。 阿里巴巴将其标注为限时促销,且未公布结束日期。如果你围绕 $1.25 / $3.75 的价格来设计架构,那么你的预算假设就存在一个无法预知的有效期。按官方定价来看,3.8-Max 才是更便宜的模型。
- 思考 token 会推高实际账单。 Qwen 3.8-Max 默认的
reasoning_effort为xhigh,而思考 token 是按输出计费的。你每次请求的实际成本可能会远高于标签价。我们的 Qwen 3.8 定价指南详细分析了缓存经济学和单次任务成本的计算。
如果两款 Max 模型都不符合你的预算,那么价格为 $0.4 / $1.6(目前有 20% 的折扣)的 qwen3.7-plus 仍然是高性价比的选择。《Plus 对比 Max》的评测文章详细介绍了在哪些情况下 Plus 已经足够好用。
开源权重:Max 级别的首次尝试
以前从未有任何 Qwen-Max 级别的模型开源过权重。Qwen 3.7-Max 没有开源,且阿里巴巴也从未暗示会开源。Qwen 3.8-Max 打破了这一惯例:发布日志承诺“下周”将在 Hugging Face 和 ModelScope 上提供权重,这大概是指 8 月 10 日左右。
截至撰写本文时(2026 年 8 月 3 日),这些权重尚无法下载。暂且将这一承诺视为可信的预告。先例令人鼓舞:Kimi K3 的权重在发布后 11 天送达,且阿里巴巴在较小体量的 Qwen 模型上有着长期的开源权重记录。但即使经过量化,下载 2.4T parameter 也是一个需要多节点部署的自托管工程,因此对大多数团队而言,实际影响将体现在第三方托管接入和价格压力上,而不是直接在自己的机架上运行该模型。
如果开源权重对你的采购或合规流程至关重要,单凭这一点可能就能决定选择 3.7 还是 3.8。其中一个模型(可能)会提供开源权重,而另一个永远不会。
哪些没有改变
这值得明确说明,因为升级推广文章往往容易夸大其词:
- 上下文窗口:两者均为 1M token。 未做扩展。如果您为了长上下文选择 3.7-Max,3.8-Max 在整个窗口内以统一的价格维持在相同的 1M。
- 访问路径:相同。 两款模型均通过阿里云百炼(Model Studio)提供服务,并带有兼容 OpenAI 的接口。切换只需更改模型 ID(从
qwen3.7-max改为qwen3.8-max),无需进行迁移项目。此外,3.8-Max 还新增了兼容 Anthropic 的 API 接口。如果您的工具支持该协议,非常值得在类似 Apifox 的客户端中进行尝试。 - 推理控制:现已正式支持。
reasoning_effort是 3.8-Max 上一个有文档记录且受支持的 parameter,提供三个级别(默认为 xhigh、medium、low),同时还有enable_thinking和preserve_thinking。如果您之前针对 3.7-Max 的隐式推理行为调整了提示词,现在您将获得一个显式的控制拨盘。
您应该升级吗?三条坦诚的路径
如果符合以下情况,请立即升级: 您的工作负载是基于 Agent 的或重度依赖研究的。Terminal Bench(从 74.5 提升至 86.6)和 PaperBench(从 64.8 提升至 93.0)的增幅是您在生产环境中能明显感知到的跨越,而且您还能额外获得图像输入支持以及更低的目录价。如果您正在构建操作终端、复现技术工作或处理屏幕截图的 Agent,那么升级的理由已经非常清晰了。
如果符合以下情况,请继续享受 3.7-Max 的促销优惠: 您的工作负载处于性能提升平缓的领域。GPQA 风格的知识类任务仅提升了 0.2 分。如果您的流量主要是问答、总结或通用聊天,且 3.7-Max 已经能够满足您的质量标准,那么 $1.25 / $3.75 将是两款 Max 模型中所能提供的最划算的单 token 价格。建议在日历中设置一个提醒,每月重新检查一次促销状态,并明确您的后备价格是 3.8-Max 的 $2 / $6,而不是 3.7-Max 的目录价。
如果符合以下情况,请降级到 qwen3.7-plus: 您对价格较为敏感且任务较为常规。在输入方面,它的价格为 $0.4 / $1.6,比 3.8-Max 便宜了 5 倍,而对于分类、提取和模板化生成而言,Max 级别的能力往往是浪费支出。
在决定之前测试切换
厂商的基准测试(即使是内部一致的测试)也无法预测模型在您的提示词上的表现。解决这个问题最划算的方法是在您实际的工作负载上进行对比测试。
在 Apifox 中,您可以在几分钟内完成此设置:将一个集合指向百炼(Model Studio)兼容 OpenAI 的接口,然后创建两个仅在模型 ID 变量上有所不同的环境,一个设置为 qwen3.7-max,另一个设置为 qwen3.8-max。针对两者运行相同的请求集,一键切换环境,并从响应查看器中对比输出、延迟和 token 使用情况。由于两款模型共享相同的 API 接口,单个集合即可覆盖两者,并且您可以将具有代表性的生产环境提示词保存为测试场景,并在阿里巴巴发布更新或促销价格发生变化时重新运行它们。
这让“我们该升级吗?”从一场关于基准测试的口水战,变成了只需一个下午就能见分晓的实证过程。下载 Apifox 即可免费体验,在修改生产配置之前,针对您自己的实际流量运行对比测试。
FAQ
Qwen 3.8-Max 比 Qwen 3.7-Max 更便宜吗?
从官方定价来看,确实如此:每 100 万 token 为 2 美元 / 6 美元,而 3.7-Max 是 2.5 美元 / 7.5 美元。但以目前的实际价格来看,并非如此:3.7-Max 限时 5 折优惠使其价格降至 1.25 美元 / 3.75 美元,比 3.8-Max 便宜了 38%。该优惠活动尚未公布截止日期。完整的费用细分请参阅我们的 Qwen 3.8 价格指南。
从 qwen3.7-max 切换到 qwen3.8-max,我需要修改代码吗?
对于基本用法,不需要。这两个模型都通过相同的、兼容 OpenAI 的 Model Studio 接口提供服务,因此切换只需更换模型 ID。您可能需要显式设置 reasoning_effort,因为 3.8-Max 默认设置为 xhigh,且思考 token 是作为输出计费的。如果您需要发送图片,这是 3.8-Max 独有的功能,并且需要使用标准的图片输入消息格式。
Qwen 3.7-Max 开源权重了吗?
没有,而且根据阿里巴巴对该系列的历史做法,以后也不会。Qwen 3.8-Max 是首个承诺开源权重的 Max 级别模型,预计将于 2026 年 8 月 10 日左右在 Hugging Face 和 ModelScope 上线。截至 8 月 3 日,它们还无法下载。
Qwen 3.8-Max 现在比 Claude 或 GPT 更好吗?
这取决于具体的对比项,而且请记住,这些都是阿里巴巴自己公布的数据。在他们的表格中,3.8-Max 在 Terminal Bench 2.1 上击败了 Opus 4.8 和 Fable 5,并在 PaperBench 和 IFBench 上领先于所有其他模型。但在 SWE-bench Pro 上,它远远落后于 Fable 5(67.7 对比 80.0),在 HLE 上则落后于所有处于前沿水平的模型。目前还没有独立的基准测试数据,因此在第三方评估出炉之前,先不要急于下最终结论。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会