OpenAI Ultrafast:6 倍速度、6 倍价格,什么时候值得用

OpenAI Ultrafast 让 GPT-6 Astra 提速最高 6 倍,价格同为 6 倍(每百万 token $60/$300)。本文介绍如何开启 service_tier ultrafast,以及它在什么场景下划算。

用 Apifox,节省研发团队的每一分钟

OpenAI Ultrafast:6 倍速度、6 倍价格,什么时候值得用

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

OpenAI Ultrafast 是一个服务层级,不是新模型。把 service_tier: "ultrafast" 加到针对 gpt-6-astra 的 Responses API 请求中后,OpenAI 在 API 中的 token 生成速度最高提升到 6 倍(在 Codex 中最高 8 倍,也就是每秒 300 tokens)。它的价格是 Standard 的 6 倍:每 100 万 tokens 输入 $60、输出 $300,而 Standard 是 $10 和 $50。模型 ID 不变,所以答案是更快,而不是更聪明。当有人类或某个对延迟敏感的步骤需要等待长输出时,它物有所值;对批处理或后台任务则几乎从不划算。

OpenAI 在 2026 年 9 月 29 日的 DevDay 上让 Ultrafast 在 GPT-6 Astra 上全面可用(参见 DevDay 的其他全部内容)。本文涵盖可用性、请求方式、价格、速率限制,以及一个你可以用自己数据重新计算的盈亏平衡模型。关于模型本身,请阅读 GPT-6 Astra API 指南。切换之前,你会在 Apifox 中测量两个层级。

OpenAI Ultrafast 速览

项目 详情
是什么 OpenAI API 中最快的服务层级
参数 service_tier: "ultrafast",用于 Responses 的 create 或 WebSocket 的 response.create
模型 目前是 GPT-6 Astra;GPT-6.1 Sol“即将推出”
速度说法 API 中 token 生成最高快 6 倍;Codex 中最高 8 倍(每秒 300 tokens)
价格(Astra) 每 100 万 tokens:输入 $60、缓存 $6、缓存写入 $75、输出 $300
速率限制 50 万 TPM(Tier 1-3)、100 万(Tier 4)、500 万(Tier 5)
处理位置 仅支持美国数据驻留和全局处理;没有 EU 或其他区域节点
传输方式 强烈推荐 WebSockets
ChatGPT 套餐 Pro 500 和 Enterprise 上的 ChatGPT Work 与 Codex

来源:OpenAI 的 Ultrafast mode 指南 和 定价页面。

Ultrafast 是什么,谁能使用

OpenAI 的 DevDay 回顾把 Ultrafast 称为其高级速度层级。根据该指南,GPT-6 Astra Ultrafast 以较低的默认速率限制向所有 API 用户开放,拥有 OpenAI 客户团队的机构可以申请更高额度。指南还列出了通过客户团队获得 GPT-5.6 Sol 预览访问的方式(OpenAI 首次预览 Ultrafast 是在 8 月 13 日的 GPT-5.6 Sol 上),而回顾中把 GPT-6.1 Sol 列为下一个。两者都未公布 Ultrafast 价格。

在 ChatGPT 中,Ultrafast Astra 运行于 Pro 500 和 Enterprise 的 ChatGPT Work 与 Codex 中。该订阅覆盖的是应用,而不是 API:你自己构建的脚本、CI 任务和 agent 仍然需要用 API key 按 token 付费。

请仔细看这个速度说法。它说的是 token 生成,而且用了“最高”。每秒 300 tokens 这个数字针对的是 Codex;API 方面宣称的是最高 6 倍。OpenAI 没有公布 Ultrafast 的首 token 延迟(TTFT)数据,而每秒 token 数并不能说明你要等多久才能拿到第一个 token。

如何启用 service_tier ultrafast

把 model 设为 gpt-6-astra,把 service_tier 设为 ultrafast,每个请求都要这样设置。下面是 OpenAI 文档中通过 HTTP 调用的示例:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "Explain why the sky is blue in one sentence.",
    "service_tier": "ultrafast"
  }'

OpenAI 强烈推荐使用 WebSockets,尤其是那些会连续发起大量工具调用的 agent,因为每次请求的网络开销会吃掉这部分收益。下面是文档中的 Python 示例,在一个连接上流式处理两轮对话:

from openai import OpenAI

client = OpenAI()
previous_response_id: str | None = None
prompts = [
    "Explain why the sky is blue in one sentence.",
    "Now explain why sunsets look red.",
]

with client.responses.connect() as connection:
    for prompt in prompts:
        connection.response.create(
            model="gpt-6-astra",
            service_tier="ultrafast",
            previous_response_id=previous_response_id,
            input=prompt,
        )
        for event in connection:
            if event.type == "response.output_text.delta":
                print(event.delta, end="", flush=True)
            elif event.type == "response.completed":
                previous_response_id = event.response.id
                print()
                break
            elif event.type in {"response.failed", "response.incomplete", "error"}:
                raise RuntimeError(event.to_json())
        else:
            raise RuntimeError("Connection closed before the response finished.")

安装命令为 pip install --upgrade "openai[realtime]",并设置 OPENAI_API_KEY。我们的 OpenAI WebSocket mode 指南介绍了连接数限制和重连。

Ultrafast 与 Standard、Fast、Batch 的价格对比

以下价格是 gpt-6-astra 在短上下文下的每 100 万 tokens 价格(输入 27.2 万 tokens 及以下):

层级 输入 缓存输入 缓存写入 输出 相对 Standard
Standard $10.00 $1.00 $12.50 $50.00 1x
Batch or Flex $5.00 $0.50 $6.25 $25.00 0.5x
Fast $20.00 $2.00 $25.00 $100.00 2x
Ultrafast $60.00 $6.00 $75.00 $300.00 6x

输入超过 27.2 万 tokens 后,Ultrafast 涨到输入 $120、缓存 $12、缓存写入 $150、输出 $450。Fast 就是原来的 Priority processing,于 2026 年 7 月 30 日更名。注意输入相关的每一列也都被乘以了倍数,因此长 prompt 会在速度说法并未覆盖的 token 上付出 6 倍价格。

速率限制与数据驻留

GPT-6 Astra 的 Ultrafast 默认限制为:用量 Tier 1-3 每分钟 50 万 tokens,Tier 4 为 100 万,Tier 5 为 500 万。Ultrafast 仅支持美国数据驻留和全局处理。如果你的合约要求流量走 EU 或其他区域节点,该项目就无法使用 Ultrafast。

Ultrafast 何时物有所值:一个盈亏平衡模型

这只是基于标价的示例计算,不是基准测试。其中唯一的速度输入是个占位值:假设你自己的测量显示,在你的 prompt 上 Standard Astra 每秒流式输出 40 个 tokens。请替换成你的实测数字。

一个面向用户的回答: 5,000 个未缓存输入 tokens,2,000 个输出 tokens。

  • Standard:输入 $0.05 + 输出 $0.10 = $0.15。
  • Ultrafast:$0.30 + $0.60 = $0.90,多出 $0.75。
  • 生成时间:Standard 下 2,000 / 40 = 50 秒,在完整的 6 倍下约为 8.3 秒。你节省了大约 41.7 秒。
  • 每节省一秒的成本:$0.75 / 41.7 = $0.018,也就是每消除一小时的等待花费 $64.80。

如果实测加速比低于这个上限,每节省一秒的成本就会更高:

实测加速比 节省的秒数(共 50 秒) 每秒额外成本 每小时节省
6x 41.7 $0.018 $64.80
4x 37.5 $0.020 $72.00
2x 25.0 $0.030 $108.00

一个 agent 循环: 20 个步骤,每步 20,000 个输入 tokens(18,000 缓存、2,000 新增)和 500 个输出 tokens,忽略缓存写入费用。

  • Standard:缓存 $0.018 + 新增输入 $0.020 + 输出 $0.025 = 每步 $0.063,每次运行 $1.26。
  • Ultrafast:每次运行 $7.56,多出 $6.30。
  • 生成时间:Standard 下 250 秒,6 倍时约 41.7 秒。你大约节省 208 秒。
  • 每节省一秒的成本:约 $0.030,即每小时 $109。

agent 换取秒数的性价比更差,因为它的大部分账单是输入,而输入拿到的是 6 倍价格,却没有生成速度的提升。如果只看输出且在完整的 6 倍下,每节省一秒的成本约为 $0.0003 乘以你 Standard 下的每秒输出 token 数;输入只会把这个数字抬高。

所以问题很具体:这几秒里被阻塞的是一个人,还是某个有明确价值的东西?这段等待是否值每小时 $65 到 $110?被你的内部编码 agent 卡住的工程师,或者在付费流程里盯着加载动画的客户,能过这条线。定时任务不能。

Ultrafast 不划算的场景

  • 没人在等。 夜间评测、回填和报表应该用 Batch API 或 Flex,输入 $5、输出 $25,只有 Ultrafast 费率的十二分之一。
  • 后台 agent。 如果 agent 无人值守运行并在完成后汇报,提前三分钟结束很少会改变结果。
  • 短输出。 50 个 token 的分类任务没有多少生成时间可压缩;连接建立和等待首个 token 才是主要开销,尤其是在 HTTP 下。
  • 长 prompt。 输入为主的调用要为速度说法并未覆盖的 token 支付 6 倍价格,而且输入超过 27.2 万后,费率会涨到 $120 和 $450。
  • 区域处理。 没有 EU 节点。
  • 受 TTFT 限制的调用。 我们的 GPT-6 Sol 延迟分析发现,在长时间推理中,大部分时间都花在第一个可见 token 出现之前。如果你的延迟主要在这里,先测量 Ultrafast 是否能缩短它,再决定付费。

切换之前,在 Apifox 中测量 TTFT 和总耗时

大约十分钟就能把占位值换成你自己的数字。

  1. 在 Apifox 中创建环境,加入 OPENAI_API_KEY。添加一个 POST 请求,指向 https://api.openai.com/v1/responses,header 为 Authorization: Bearer {{OPENAI_API_KEY}},body 如下:
{
  "model": "gpt-6-astra",
  "input": "<your real production prompt>",
  "service_tier": "ultrafast",
  "stream": true
}
  1. 复制这个请求,去掉 service_tier,作为 Standard 基线。保持 prompt 完全一致。
  2. 两个都发送。Apifox 会逐个事件渲染 server-sent events 流。记录第一个 response.output_text.delta 到达的时间(TTFT)以及流结束的时间(总耗时);保留 usage 数据块——它来自最终 response.completed 事件——用于计算成本。
  3. 每个变体至少重复 10 次,比较中位数和 p95,而不是单次运行结果。
  4. 对于 agent 循环,要测试 WebSocket 路径:在 Apifox 中打开一个指向 wss://api.openai.com/v1/responses 的 WebSocket 请求,使用相同的 header,发送一条 response.create 消息,字段与上面相同但不含 stream,然后再发一轮,带上 previous_response_id。WebSocket vs SSE 对比解释了为什么保持连接很重要。

节省的秒数等于 Standard 的中位总耗时减去 Ultrafast 的中位总耗时。把 usage 的 tokens 按两种费率分别计价,相除,再把结果与这段等待对你的成本做比较。

常见问题

OpenAI Ultrafast 是什么? 一个 Responses API 的服务层级,在 API 中以 Standard 6 倍的价格带来最高 6 倍的 token 生成速度。你可以按请求启用它,方式是设置 service_tier: "ultrafast"。

Ultrafast 是更聪明的模型吗? 不是。你调用的还是同一个 gpt-6-astra 模型 ID;改变的是速度和价格,而不是模型本身。

GPT-6 Astra Ultrafast 的价格是多少? 在短上下文下每 100 万 tokens 输入 $60、缓存输入 $6、缓存写入 $75、输出 $300,而 Standard 分别是 $10、$1、$12.50 和 $50。

“每秒 300 tokens”这个数字从哪来? 这是 OpenAI 给出的 Ultrafast 在 Codex 中的数字,那里宣称最高 8 倍。API 方面宣称的是最高 6 倍。

GPT-6.1 Sol 支持 Ultrafast 吗? 还不支持。OpenAI 表示即将推出;DevDay 2026 汇总会跟踪已上线的内容。

下一步

挑一个最慢的面向用户的请求,分别在 Standard 和 Ultrafast 下各跑 10 次,用中位数算出节省的秒数,再与额外成本做对比。在 Apifox 中把两个变体、各自的耗时和 usage 数据保存在同一个项目中。


HiFox:将 Agent 变成真正的队友

另外,我们也在思考,AI 如何从个人提效走进团队协作。

HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。

👉 立即体验 HiFox:https://hifox.com

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

AI Coding 交流群