在对阵 GPT-6 Astra、Claude Opus 5.5 和 Claude Fable 5.1 的对比中,Gemini 4 Argon 在 Google 基准测试表格的 19 行里领先 13 行,但有一个事实比任何分数都更有分量:Astra 和 Opus 5.5 今天就能买到,而 Argon 不能。Google 的这款新前沿模型目前只对 Fairwind Program 的防御方开放,推广期内每百万 tokens 为 $2/$10,之后为 $4/$20,这恰好与 Opus 5.5 的价格相同。
这篇对比把四个模型的价格和限制放在一起对照,按哪一方胜出对基准测试行进行归组,解释这些数字为什么不能直接横向比较,最后给出一份路由指南,以及一种在 Apifox 中用你自己的提示词测试这三个模型的方法。刚接触 Argon?可以先看什么是 Gemini 4 Argon;关于时间安排,见 Argon 发布日期指南。
价格与限制对照
Google 的表格中包含了 Claude Fable 5.1,所以它也有一列。价格均为每 1M tokens,来自各家自己的页面:Google 的 发布公告、OpenAI 的 GPT-6 Astra 模型页面 以及 Anthropic 的 定价页面。
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| 今天能调用吗? | 不能,仅限 Fairwind | 能 | 能 | 能 |
| API 模型 ID | 未公布 | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| 输入 | $2 推广价,之后 $4 | $10 | $4 | $10 |
| 缓存输入 | $0.10 推广价,之后 $0.20 | $1 | $0.20 | $0.25 |
| 输出 | $10 推广价,之后 $20 | $50 | $20 | $50 |
| 最大输出 | 1M(Google 声明的上限) | 128K | 128K(Batch 上为 300K,beta) | 128K |
| 上下文窗口 | 未公布 | 1,050,000(最大输入 922K) | 1M | 1M |
| 长提示词附加费 | 未说明 | 输入超过 272K 时:对整个请求的输入和缓存按 2 倍、输出按 1.5 倍计费 | 无 | 无 |
有三点值得注意。Argon 的标准价在输入、缓存输入和输出上都与 Opus 5.5 相同,因此它相对 Anthropic 的价格优势只在推广期内存在,而 Google 并未给出推广期的结束日期。Astra 和 Fable 5.1 的标价是 Argon 标准输入输出费率的 2.5 倍,是其推广价的 5 倍。另外,1M 输出这个数字来自 Google:Vals AI 对它测试的 Argon 配置给出的最大输出是 262K。关于单次请求的成本计算,见 Gemini 4 Argon 定价。
在 Google 的表格中,各模型各自领先的项
在看数字之前先说明:这是 Google 的表格。Argon 的分数由 Google 报告,其中一些是自行计算的,一些来自排行榜;竞品分数大多来自厂商自己的数字或公开排行榜结果,在可获得的情况下采用最高推理设置。由于测试工具链存在差异,小的差距可以视为噪声。
| 领先者 | 基准测试 | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon:知识工作 | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon:知识工作 | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon:知识工作 | Harvey’s Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon:编码 | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon:长上下文 | GraphWalks 256K to 1M (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon:多模态 | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon:多模态 | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0 (offline, partial) | 69.2% | 72.6% | 未报告 | 未报告 |
| Opus 5.5 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| 平局 | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
Argon 其他明显胜出的还有 Vals Finance Agent v2、Vibe Code Bench、LABBench 2、RiemannBench、GraphWalks 128K 以内以及 Agent’s Last Exam。Fable 5.1 没有在任何一行领先。在 CWE-bench v1 上,DeepMind 的 网络安全排行榜 显示 Argon、Astra 和 Grok 4.7 以 68% 三方并列,Opus 5.5 为 67%。
在 Gemini 4 Argon vs Fable 5.1 上,两者都给出数字的 17 行中 Argon 有 15 行更高;Fable 只在 FrontierSWE v2(56.3% vs 55.0%)和 Terminal-bench 4.0(57.9% vs 57.4%)上略胜。Anthropic 自己的数据见我们的 Claude Fable 5.1 基准测试文章,完整的 19 行表格在 Gemini 4 Argon 基准测试中。
在相信这些差距之前,先看三点提醒
竞品数字不是 Google 自己跑出来的。 Google 的 方法论 说明,非 Gemini 模型的结果“除非另有说明,均来自各提供方自行报告的数字”,其中若干行来自 Vals AI、Proximal 和 Surge 运营的公开排行榜。
测试工具链不同。 在 DeepSWE v1.1 上,Google 用 mini-swe-agent 工具链自行计算了 Argon 的 77.9%,而 Astra 的分数来自公开排行榜,Anthropic 的分数来自系统卡片。在 LVBench 上,Gemini 以每秒 1 帧采样视频,而 Astra 得到 800 帧、Opus 5.5 为 600 帧、Fable 5.1 为 300 帧,“原因是 API 限制”。
同一个模型在不同图表中得分不同。 Opus 5.5 的 Terminal-bench 4.0 数字在不同图表之间会因工具链和 effort 设置而变化;Anthropic 报告 其 66.4% 是在 xhigh effort 下取得的。所以不要把不同来源混在同一张表里。
第三方评测机构怎么说
独立排行榜会缩小差距。Artificial Analysis 把 Argon 列为 223 个条目中的第 8,但该列表把每种推理设置单独计数。按不同模型来看,Argon(53)与 GPT-6 Astra 和 Claude Fable 5.1 持平,落后于 Claude Opus 5.5(最高设置下为 58)和 Claude Sonnet 5.5(56)。AA 还列出 Argon 在 AA-Omniscience 上的幻觉率为 15%,而 Astra 在其最高设置下为 51%。
在 Arena 上,Argon 以 1525 分在 Text 榜排名第一,基于 4,942 票标记为 Preliminary,Opus 5.5 位列第四。Vals AI 把它列为 Vals Index 上 41 个模型中的第一名,这是首个登顶该榜单的 Gemini 模型。
Google 内部并非所有人都信服:彭博社报道,一些有访问权限的员工称,相对于其基准测试成绩,Argon 在某些编码和前端设计工作上表现平平,Google 称这一说法不准确。
该路由到哪一个
2026 年不存在唯一最好的前沿模型。按任务路由,并把 Argon 那一列留到它上线的那天:
| 任务 | 当前路由到 | Argon 上线后 |
|---|---|---|
| 法律、金融和办公自动化 Agent | Opus 5.5 (67.0% Vals Index) | 测试 Argon:它在全部四个知识工作行上都领先 |
| 大量使用终端的编码 Agent | Opus 5.5 (66.4% Terminal-bench 4.0) | 仍是 Opus 5.5 领先 |
| Agent 化软件工程 | Astra (65.5% FrontierSWE v2) 或 Opus 5.5 | Argon 在 DeepSWE 领先但在 FrontierSWE 落后;两者都测 |
| 计算机操作与 GUI Agent | Astra (72.6% OSWorld-2.0) | Astra 在 OSWorld 领先;Argon 在 Agent’s Last Exam 领先 |
| 对 256K+ tokens 提示词的推理 | Opus 5.5(无附加费)或 Astra(超过 272K 有附加费) | Argon (84.2% GraphWalks 256K to 1M) |
| 视频与图表理解 | Astra (87.5% LVBench) | Argon (91.7%),但需要注意帧数差异 |
| 科学与 ML 工程 | Astra (Terminal-Bench Science)、Opus 5.5 (PostTrainBench) | Argon 在 LABBench 2 和 RiemannBench 领先;测一测它 |
| 超过 128K tokens 的单次响应 | Opus 5.5 的 Batch(300K,beta) | Argon,最高到 Google 声明的 1M |
| 大流量、成本敏感的任务 | Opus 5.5($4/$20) | 推广期内 Argon 为 $2/$10 |
如果价格比峰值分数更重要,我们的 GPT-6 Sol vs Claude Opus 5.5 对比介绍了 OpenAI 更便宜的 Sol 系列与 Opus 的比较。
用你自己的提示词对比这三个模型
厂商的表格无法告诉你每个模型在你的提示词上表现如何,而在 Apifox 中做一个小评测就可以,而且今天就能搭起来。
- 创建一个项目,包含三个请求:GPT-6 Astra、Claude Opus 5.5,以及一个 model 字段为
{{GEMINI_MODEL}}的 Gemini 请求;在 Google 公布 Argon 的 ID 之前,把它设为gemini-3.8-flash。我们的 GPT-6 Astra API 指南和什么是 Claude Opus 5.5 分别介绍了各家厂商的请求格式。 - 把各厂商的 API key 存为环境变量,并把提示词放在一个共享变量里,这样三个请求得到完全相同的输入。
- 添加断言:状态码 200、回答非空、输出 tokens 低于某个上限,以及按各厂商公布费率计算出的成本低于你的预算。
- 把这三个作为一个测试场景运行,并在测试报告中比较每个请求的结果。
成本断言就是普通的算术。对于一个 20,000 输入、4,000 输出 tokens 的请求,Astra 的成本是 20,000 x $10/1M + 4,000 x $50/1M = $0.20 + $0.20 = $0.40。Opus 5.5 的成本是 $0.08 + $0.08 = $0.16。Argon 按推广价是 $0.08,按标准价是 $0.16。不过每 token 价格并不等于每任务成本:Artificial Analysis 测得 Argon 每任务约 62K 输出 tokens,而 Astra 在最高 effort 下约为 27K,所以要在你自己的提示词上测量输出 tokens。
当 Argon 上线时,修改 GEMINI_MODEL、重新运行该场景,你就得到了与现在可购买的两个模型在同一提示词下的对比。
FAQ
Gemini 4 Argon 比 GPT-6 Astra 更好吗? 在 Artificial Analysis 上两者同为 53。在 Google 的表格里 Argon 在多数行上分数更高,但 Astra 赢下 FrontierSWE v2、Terminal-Bench Science 0.1 和 OSWorld-2.0,而且今天能调用的是 Astra。
Gemini 4 Argon vs Claude Opus 5.5:哪个更好? Google 的表格在多数行上偏向 Argon;Opus 5.5 赢下 Terminal-bench 4.0 和 PostTrainBench,并在 Artificial Analysis 上以 58 比 53 领先。按标准价计,两者价格相同。
Gemini 4 Argon 比 Claude Opus 5.5 便宜吗? 推广期内它是半价($2/$10 vs $4/$20)。之后标价完全相同,而 Google 尚未说明推广期何时结束。
哪个模型的输出上限最大? Argon,声明值为 1M tokens,尽管 Vals AI 对它测试的配置列出 262K。其他模型的同步输出上限为 128K。我们的 1M output tokens 指南介绍了这对你的客户端意味着什么。
我今天可以使用 Gemini 4 Argon 吗? 只能通过 Google 的 Fairwind Program,面向一批经过审核的网络防御合作伙伴。接下来是付费 API 客户和 Google AI Ultra 订阅者,但没有具体日期。
按工作负载选型,然后测试
Argon 在知识工作、长上下文和多模态行上看起来最强;Astra 在 FrontierSWE、Terminal-Bench Science 和 OSWorld 上最强;Opus 5.5 在终端类任务和 ML 工程上最强,价格也正是 Argon 推广期结束后的定价。先在现在可购买的两个模型上做开发,把 Gemini 的模型名放在变量里,等 Argon 开放当天重新运行你的场景。要在一个项目里搭建这三请求对比,配置好这三个请求即可。
HiFox:将 Agent 变成真正的队友
另外,我们也在思考,AI 如何从个人提效走进团队协作。
HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。
👉 立即体验 HiFox:https://hifox.com
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。