Anthropic 于 2026 年 7 月 24 日发布了 Claude Opus 5。仅在一小时内,每个团队都提出了相同的问题:如果 Opus 5 以一半的价格就能达到接近 Fable 5 的水平,为什么还有人会继续为 Fable 5 买单?
数据非常直观。Opus 5 的价格为每百万输入 token $5,每百万输出 token $25。Fable 5 的价格则是 $10 和 $50:两者的差距正好是 2 倍,且没有任何关于层级或最低消费的限制条款。Anthropic 官方在发布时声称,在 CursorBench 3.2 评测中,Opus 5 的表现与 Fable 5 的峰值相差在 0.5% 以内,并且在 OSWorld 2.0 上以三分之一的成本超越了 Fable 5。
如果你想亲自进行对比,可以通过 Apifox 向这两个模型 ID 发送相同的 prompt,并并排对比它们的响应和 token 数量。
“知识截止日期”这一行打破了通常“新一代更便宜,老一代更聪明”的常规认知。Opus 5 了解的世界截至 2026 年 5 月。而 Fable 5 则停留在 2026 年 1 月,与 Sonnet 5 的截止时间相同。这意味着 Opus 5 的训练数据中包含了多出四个月的依赖包发布、框架版本更新和 API 变更,而 Fable 5 则没有。如果你的工作涉及迭代迅速的库,那么这款更便宜的模型反而更加及时。

而“定位”这一行则恰恰相反。Anthropic 仍将 Fable 5 描述为其能力最强的公开版本模型,并没有将这一标签赋予 Opus 5。Opus 5 被定位为推荐的默认选择,这有着不同的含义:它是你犹豫不决时的首选,但当任务处于任何模型所能达到的极限边缘时,它并不是你的第一选择。
欲了解这款新模型的完整规格表,请参阅我们的 Claude Opus 5 详解。有关 Fable 5 的发布详情,请参阅什么是 Claude Fable 5。
现在说一下注意事项,因为这是问题的关键。每一个数据都是由厂商自行运行测试的。 Anthropic 设计了评估方案,选择了 effort 设置,并公布了结果。截至 2026 年 7 月 25 日,没有任何一项结果被独立复现。这 food 并不是指责其缺乏诚信,而是发布后第二天的正常状态。但是,“与 Fable 5 的差距在 0.5% 以内”描述的是在特定配置下的特定测试基准,而在你自己的任务上测得的差距可能会更大或更小。
在这两个正面交锋的数据中,关于 OSWorld 的声明更有意思,因为据说 Opus 5 在这项测试中是击败了 Fable 5,而不仅仅是接近它。计算机使用任务更看重坚持(persistence)和恢复能力(recovery),而非纯粹的推理深度,这非常契合针对智能体循环(agentic loops)进行过微调的模型。而 CursorBench 的声明则相对保守:“在 Fable 5 峰值的 0.5% 以内”意味着 Fable 5 仍然占据着巅峰位置。
我们在《Opus 5 基准测试深度解析》中对每个数字进行了拆解,包括每个基准测试衡量了什么以及没有衡量什么。Fable 5 自身发布时的数据则可以在《Fable 5 基准测试》一文中找到。
选择 Opus 5 的理由
价格差距是恒定的,且会产生累加效应。 在对比 $5/$25 与 $10/$50 的单价下,对于相同数量的 Token,在 Fable 5 上每月花费 $3,000 的工作负载,在 Opus 5 上只需 $1,500。没有任何门槛或承诺性消费能缩小这一差距。
各种省钱杠杆在价格减半的基础上进一步叠加。 Opus 5 的 Batch API 费率仅为 $2.50/$12.50,相当于在减半基础上再打五折。缓存命中和刷新的费用为每百万 Token $0.50,且 prompt 缓存的起步线降至 512 Token(Opus 4.8 为 1,024 Token),因此以前因过短而无法缓存的简短系统 prompt,现在无需修改代码即可实现缓存。工具调用的系统 prompt 开销也更低:在将 tool_choice 设置为 auto 或 none 时,仅需 286 Token,而 Opus 4.8 需要 290 Token,Opus 4.7 则需要 675 Token。这些因素加在一起,能显著降低实际账单。我们的《Opus 5 价格细分》包含完整的表格,而《削减你的 Claude API 账单》一文则介绍了通用的优化手段。
当任务需要时,你可以增加投入。 Opus 5 的 output_config.effort parameter 默认值为 high,且这些级别在发布时进行了重新校准,其中 low 和 medium 比之前的 Opus 模型有了显著的增强。这为你提供了一个调节旋钮,而不是固定费率:在 low 级别进行廉价的分类,在 xhigh 级别进行困难的智能体编码。 《effort parameter 指南》解释了应该如何进行参数扫描测试,而不是直接套用旧的设置。
它是一个更新的模型,领先了四个月。
这也是默认设置的发展方向。 Opus 5 是 Max 订阅用户的新默认选择,也是 Pro 用户可用的性能最强的模型。它已在 Claude API、claude.ai、Claude Code、Claude Cowork、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud、Microsoft Foundry 和 GitHub Copilot 上上线。Anthropic 的模型概览中明确指出,如果你不确定该使用哪款模型,请先从 Opus 5 开始。
选择 Fable 5 的理由
为昂贵模型寻找最合理论据需要更费些心思,因此我们不妨说得具体一些,不用客气。
能力定位并没有改变。 Anthropic 本可以在发布当天将 Opus 5 冠以其“已广泛发布的性能最强模型”的称号,但它并没有这样做。当一家厂商在推出一款大肆宣扬的更便宜模型时,却依然把最高赞誉保留给那款更旧、更贵的模型,这代表了其在能力曲线顶端的某种信号,而不是营销上的疏忽。在面对最棘手的问题(即单次失败运行的成本就超过一个月 API 开销的场景)时,Fable 5 依然是 Anthropic 极力推荐的模型。它的发布公告就是这一发布定位的参考。
“始终开启”的思考消除了某类失效模式。 Fable 5 在处理每个请求时都会进行思考:Anthropic 的模型对比中将其自适应思考列为“始终开启(always on)”,且它是目前唯一被这样描述的模型。Opus 5 允许你禁用思考,而 Anthropic 官方的提示词指南记录了这样做会发生什么:工具调用有时会被写成纯文本而不是被执行(这些泄露的文本随后会污染 Agent 循环中的后续轮次),内部 XML 标签有时也会出现在可见的输出中。Anthropic 推荐的缓解措施是保持思考处于开启状态,并转而通过降低思考强度(effort)来控制成本。一个从不提供“搬起石头砸自己脚(footgun)”机制的模型,用户自然不会因此受害。
Opus 5 的灵活性也有其棘手之处。 将 thinking: {type: "disabled"} 与 xhigh 或 max 的 effort 结合使用会返回 400 错误,这在每个请求中都是强制执行的。当你省略 thinking 字段时,思考默认会运行,因此为非思考工作负载设计的 max_tokens 预算可能会被截断。Opus 5 还更容易将任务委派给子 Agent,并生成更长的默认响应,如果不加以限制,这两者都会悄悄增加成本。Fable 5 则不存在这些迁移带来的影响面。如果你确实要进行迁移,我们的 Opus 4.8 到 Opus 5 迁移指南中详述了所有的破坏性变更。
切换成本并非为零。 你的评估(evals)、提示词、effort 设置以及成本模型都是针对你当前运行的模型进行校准的。“价格减半”是针对每个 token 而言的,并不代表项目整体成本。如果迁移需要两个工程师花上一周时间,而业务负载又很小,那么这笔账在经济上是算不过来的。Fable 5 与 Opus 4.8 的对比涵盖了通常情况下 Fable 档次相比 Opus 档次能带来什么,而 Fable 5 的定价则决定了其成本结构。
真实请求中的价格差距是怎样的
倍率变化很容易让人点头认同,但实际差距却很难有直观感受。以下是一个智能体编码任务的示例:200,000 个输入 Token(包含大型代码仓库上下文以及冗长的工具调用历史)和 20,000 个输出 Token。
按每月 500 次任务计算,差额为 750 美元。这完全在大多数工程预算的容差范围内,如果 Fable 5 每月能为你的团队减少一次失败的运行,它就已经回本了。而按每月 5,000 次任务计算,差额将达到每年 90,000 美元,这已经涉及到人员编制的讨论了。
因此,决策规则取决于业务量,而不是哪个模型更聪明。 如果每月处理的困难任务少于几百个,只需根据能力进行选择,无需考虑价格。若超过几千个,你就需要有证据表明 Fable 5 在你的工作负载上表现更好,而不是仅凭 Anthropic 的测试套件。
另外算一笔账:Opus 5 的快速模式(输出速度提升 2.5 倍,目前仅作为研究预览版在第一方 API 上提供)定价为 $10/$50,正好与 Fable 5 的基础费率相同。如果延迟是首要限制因素而非能力,你可以将本准备花在 Fable 5 上的预算用于更快的 Opus 5,而不是更慢的 Fable 5。请注意,inference_geo: "us" 会在 Opus 5 的每个 Token 类别上增加 1.1 倍的乘数,使这些数据上浮 10%。
在你自己的工作负载上运行对比
厂商提供的基准测试只能告诉你它们在别人任务上的表现。决定你选择的数据应来自你自己的评估集,而获取这些数据只需花费一个下午。这两个模型都位于同一个 Messages 接口后面,因此进行对比只需要修改一个字符串:
curl https://api.anthropic.com/v1/messages \ --header "x-api-key: $ANTHROPICAPIKEY" \ --header "anthropic-version: 2023-06-01" \ --header "content-type: application/json" \ --data '{ "model": "claude-opus-5", "maxtokens": 8192, "outputconfig": {"effort": "high"}, "messages": [ {"role": "user", "content": "Refactor this handler and explain the tradeoffs."} ] }' ```
将 claude-opus-5 替换为 claude-fable-5,即可进行另一侧的测试。在 Apifox 中的实际配置如下所示:
- 将 API key 存储为环境变量,从而避免其暴露在请求 body 中,并为每个模型创建一个环境,将模型 ID 作为变量。
- 将请求保存到集合中,并在两个环境中运行相同的场景,这样唯一发生变化的就是模型字符串。
- 读取每个响应中的
usage字段。对比输入、输出以及缓存读取的 Token;这才是真实成本差异所在,因为 Opus 5 的默认响应往往更长。 - 在对比 Agent 行为时,检查 SSE 流和工具调用 payload。模型是实际执行了工具还是仅将调用作为文本写出,在原始事件流中一目了然。
- 分别在
low、medium、high和xhigh的 effort 级别下重复运行 Opus 5。真正的问题通常不是“选择 Opus 5 还是 Fable 5”,而是“Opus 5 的哪个 effort 级别能匹配我付费购买的 Fable 5 的输出效果”。
第五步是大多数团队都会忽略的一步,也是决定成本高低的关键。下载 Apifox 以配置环境,或按照我们的 Opus 5 API 指南中的完整请求演练进行操作。Anthropic 的定价页面提供了这两个模型的权威费率。
按钮
真实的上限
在此次对比中,两款模型都算不上 Anthropic 产品线中的顶级产品。
根据 Anthropic 官方的定义,Fable 5 仍然是已广泛发布的模型中能力最强的,而 Opus 5 并未获得这一标签。在这两者之上,在两个特定的能力维度上,还存在着 Mythos 5:Anthropic 表示,Opus 5 在网络安全漏洞利用和自主生物研究方面仍落后于 Mythos 5。Mythos 5 是与 Fable 5 齐名的无分类器(classifier-free)兄弟模型,仅通过有限的项目发布,并未向公众开放,因此对大多数团队来说并不是一个可选方案;我们的 Fable 5 与 Mythos 5 对比文章介绍了具体的准入资格。
因此,对 Opus 5 的准确总结比媒体头条宣传的要更为克制:以前沿级别一半的价格,获得前沿级的能力,且其上还有一个明确的上限。 这是一款强大的产品。它并不是“最好的模型现在只需一半的价格”,任何向你灌输这种说法的人,都忽略了 Anthropic 自身仍将能力桂冠保留在更昂贵模型上的事实。
常见问题
Claude Opus 5 比 Fable 5 更好吗? 在 Anthropic 自己的基准测试中,Opus 5 在 OSWorld 2.0 电脑使用任务上的表现超过了 Fable 5,并且在 CursorBench 3.2 上与 Fable 5 的峰值差距在 0.5% 以内,而成本仅为后者的一小部分。截至 2026 年 7 月 25 日,这些数据均由厂商自行测试且尚未被第三方复现。Anthropic 仍将 Fable 5 定位为其已广泛发布的功能最强大的模型,因此在最困难的任务上,Fable 5 依然保持着优势。
Opus 5 比 Fable 5 便宜多少? 输入和输出的价格正好都是后者的一半:每百万输入/输出 token 分别为 $5/$25,而 Fable 5 为 $10/$50。对于非紧急任务,Opus 5 的 Batch API 费率仅为 $2.50/$12.50,进一步拉大了这一差距。
哪款模型的知识库截止时间更新? Opus 5,领先四个月。它的可靠截止时间是 2026 年 5 月;而 Fable 5 是 2026 年 1 月。
我应该将 Fable 5 的工作负载迁移到 Opus 5 吗? 首先评估一下你的业务量。如果每月只有几百个困难任务,所节省的成本通常不足以弥补迁移的工作量。但如果超过几千个,迁移显然是值得的,前提是你的评估集确认其质量没有下降。
两者的模型 ID 分别是什么? claude-opus-5 和 claude-fable-5,均无日期后缀。在 Amazon Bedrock 上,Opus 5 为 anthropic.claude-opus-5。
有什么是 Opus 5 支持而 Fable 5 不支持的吗? Opus 5 提供了经过重新校准级别的 output_config.effort parameter,接受对话中途的系统消息,支持 $10/$50 费率的快速模式,并且可以缓存短至 512 个 token 的 prompt。反向的差距在于:Opus 5 不支持 Priority Tier,不过 Opus 4.8 仍保留了该功能。
简而言之
对大多数团队来说,半价的诱惑是难以拒绝的,而个中原因更多在于业务量而非模型能力。Anthropic 的数据表明,Opus 5 在智能体编码方面与 Fable 5 足够接近,在电脑使用方面甚至更胜一筹,在每月数千次任务的规模下,2 倍的成本节省将转化为实实在在的预算红利。再加上更新的 2026 年 5 月截止时间以及 effort 调节机制,默认的首选应当是 Opus 5。
当任务处于当前任何模型能达到的极限边缘、单次运行失败的成本高于价格差,或者你的业务量很小以至于迁移工作量超过了节省的成本时,请继续使用 Fable 5。此外,请理性看待这里的每一项基准测试:它们都是厂商在其自家测试框架下的自行测量,仍有待第三方复现。你的评估集才是最终的决定性标准。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会