OpenAI Ultrafast 是一个服务层级,不是新模型。把 service_tier: "ultrafast" 加到针对 gpt-6-astra 的 Responses API 请求中后,OpenAI 在 API 中的 token 生成速度最高提升到 6 倍(在 Codex 中最高 8 倍,也就是每秒 300 tokens)。它的价格是 Standard 的 6 倍:每 100 万 tokens 输入 $60、输出 $300,而 Standard 是 $10 和 $50。模型 ID 不变,所以答案是更快,而不是更聪明。当有人类或某个对延迟敏感的步骤需要等待长输出时,它物有所值;对批处理或后台任务则几乎从不划算。
OpenAI 在 2026 年 9 月 29 日的 DevDay 上让 Ultrafast 在 GPT-6 Astra 上全面可用(参见 DevDay 的其他全部内容)。本文涵盖可用性、请求方式、价格、速率限制,以及一个你可以用自己数据重新计算的盈亏平衡模型。关于模型本身,请阅读 GPT-6 Astra API 指南。切换之前,你会在 Apifox 中测量两个层级。
OpenAI Ultrafast 速览
| 项目 | 详情 |
|---|---|
| 是什么 | OpenAI API 中最快的服务层级 |
| 参数 | service_tier: "ultrafast",用于 Responses 的 create 或 WebSocket 的 response.create |
| 模型 | 目前是 GPT-6 Astra;GPT-6.1 Sol“即将推出” |
| 速度说法 | API 中 token 生成最高快 6 倍;Codex 中最高 8 倍(每秒 300 tokens) |
| 价格(Astra) | 每 100 万 tokens:输入 $60、缓存 $6、缓存写入 $75、输出 $300 |
| 速率限制 | 50 万 TPM(Tier 1-3)、100 万(Tier 4)、500 万(Tier 5) |
| 处理位置 | 仅支持美国数据驻留和全局处理;没有 EU 或其他区域节点 |
| 传输方式 | 强烈推荐 WebSockets |
| ChatGPT 套餐 | Pro 500 和 Enterprise 上的 ChatGPT Work 与 Codex |
来源:OpenAI 的 Ultrafast mode 指南 和 定价页面。
Ultrafast 是什么,谁能使用
OpenAI 的 DevDay 回顾把 Ultrafast 称为其高级速度层级。根据该指南,GPT-6 Astra Ultrafast 以较低的默认速率限制向所有 API 用户开放,拥有 OpenAI 客户团队的机构可以申请更高额度。指南还列出了通过客户团队获得 GPT-5.6 Sol 预览访问的方式(OpenAI 首次预览 Ultrafast 是在 8 月 13 日的 GPT-5.6 Sol 上),而回顾中把 GPT-6.1 Sol 列为下一个。两者都未公布 Ultrafast 价格。
在 ChatGPT 中,Ultrafast Astra 运行于 Pro 500 和 Enterprise 的 ChatGPT Work 与 Codex 中。该订阅覆盖的是应用,而不是 API:你自己构建的脚本、CI 任务和 agent 仍然需要用 API key 按 token 付费。
请仔细看这个速度说法。它说的是 token 生成,而且用了“最高”。每秒 300 tokens 这个数字针对的是 Codex;API 方面宣称的是最高 6 倍。OpenAI 没有公布 Ultrafast 的首 token 延迟(TTFT)数据,而每秒 token 数并不能说明你要等多久才能拿到第一个 token。
如何启用 service_tier ultrafast
把 model 设为 gpt-6-astra,把 service_tier 设为 ultrafast,每个请求都要这样设置。下面是 OpenAI 文档中通过 HTTP 调用的示例:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "Explain why the sky is blue in one sentence.",
"service_tier": "ultrafast"
}'
OpenAI 强烈推荐使用 WebSockets,尤其是那些会连续发起大量工具调用的 agent,因为每次请求的网络开销会吃掉这部分收益。下面是文档中的 Python 示例,在一个连接上流式处理两轮对话:
from openai import OpenAI
client = OpenAI()
previous_response_id: str | None = None
prompts = [
"Explain why the sky is blue in one sentence.",
"Now explain why sunsets look red.",
]
with client.responses.connect() as connection:
for prompt in prompts:
connection.response.create(
model="gpt-6-astra",
service_tier="ultrafast",
previous_response_id=previous_response_id,
input=prompt,
)
for event in connection:
if event.type == "response.output_text.delta":
print(event.delta, end="", flush=True)
elif event.type == "response.completed":
previous_response_id = event.response.id
print()
break
elif event.type in {"response.failed", "response.incomplete", "error"}:
raise RuntimeError(event.to_json())
else:
raise RuntimeError("Connection closed before the response finished.")
安装命令为 pip install --upgrade "openai[realtime]",并设置 OPENAI_API_KEY。我们的 OpenAI WebSocket mode 指南介绍了连接数限制和重连。
Ultrafast 与 Standard、Fast、Batch 的价格对比
以下价格是 gpt-6-astra 在短上下文下的每 100 万 tokens 价格(输入 27.2 万 tokens 及以下):
| 层级 | 输入 | 缓存输入 | 缓存写入 | 输出 | 相对 Standard |
|---|---|---|---|---|---|
| Standard | $10.00 | $1.00 | $12.50 | $50.00 | 1x |
| Batch or Flex | $5.00 | $0.50 | $6.25 | $25.00 | 0.5x |
| Fast | $20.00 | $2.00 | $25.00 | $100.00 | 2x |
| Ultrafast | $60.00 | $6.00 | $75.00 | $300.00 | 6x |
输入超过 27.2 万 tokens 后,Ultrafast 涨到输入 $120、缓存 $12、缓存写入 $150、输出 $450。Fast 就是原来的 Priority processing,于 2026 年 7 月 30 日更名。注意输入相关的每一列也都被乘以了倍数,因此长 prompt 会在速度说法并未覆盖的 token 上付出 6 倍价格。
速率限制与数据驻留
GPT-6 Astra 的 Ultrafast 默认限制为:用量 Tier 1-3 每分钟 50 万 tokens,Tier 4 为 100 万,Tier 5 为 500 万。Ultrafast 仅支持美国数据驻留和全局处理。如果你的合约要求流量走 EU 或其他区域节点,该项目就无法使用 Ultrafast。
Ultrafast 何时物有所值:一个盈亏平衡模型
这只是基于标价的示例计算,不是基准测试。其中唯一的速度输入是个占位值:假设你自己的测量显示,在你的 prompt 上 Standard Astra 每秒流式输出 40 个 tokens。请替换成你的实测数字。
一个面向用户的回答: 5,000 个未缓存输入 tokens,2,000 个输出 tokens。
- Standard:输入 $0.05 + 输出 $0.10 = $0.15。
- Ultrafast:$0.30 + $0.60 = $0.90,多出 $0.75。
- 生成时间:Standard 下 2,000 / 40 = 50 秒,在完整的 6 倍下约为 8.3 秒。你节省了大约 41.7 秒。
- 每节省一秒的成本:$0.75 / 41.7 = $0.018,也就是每消除一小时的等待花费 $64.80。
如果实测加速比低于这个上限,每节省一秒的成本就会更高:
| 实测加速比 | 节省的秒数(共 50 秒) | 每秒额外成本 | 每小时节省 |
|---|---|---|---|
| 6x | 41.7 | $0.018 | $64.80 |
| 4x | 37.5 | $0.020 | $72.00 |
| 2x | 25.0 | $0.030 | $108.00 |
一个 agent 循环: 20 个步骤,每步 20,000 个输入 tokens(18,000 缓存、2,000 新增)和 500 个输出 tokens,忽略缓存写入费用。
- Standard:缓存 $0.018 + 新增输入 $0.020 + 输出 $0.025 = 每步 $0.063,每次运行 $1.26。
- Ultrafast:每次运行 $7.56,多出 $6.30。
- 生成时间:Standard 下 250 秒,6 倍时约 41.7 秒。你大约节省 208 秒。
- 每节省一秒的成本:约 $0.030,即每小时 $109。
agent 换取秒数的性价比更差,因为它的大部分账单是输入,而输入拿到的是 6 倍价格,却没有生成速度的提升。如果只看输出且在完整的 6 倍下,每节省一秒的成本约为 $0.0003 乘以你 Standard 下的每秒输出 token 数;输入只会把这个数字抬高。
所以问题很具体:这几秒里被阻塞的是一个人,还是某个有明确价值的东西?这段等待是否值每小时 $65 到 $110?被你的内部编码 agent 卡住的工程师,或者在付费流程里盯着加载动画的客户,能过这条线。定时任务不能。
Ultrafast 不划算的场景
- 没人在等。 夜间评测、回填和报表应该用 Batch API 或 Flex,输入 $5、输出 $25,只有 Ultrafast 费率的十二分之一。
- 后台 agent。 如果 agent 无人值守运行并在完成后汇报,提前三分钟结束很少会改变结果。
- 短输出。 50 个 token 的分类任务没有多少生成时间可压缩;连接建立和等待首个 token 才是主要开销,尤其是在 HTTP 下。
- 长 prompt。 输入为主的调用要为速度说法并未覆盖的 token 支付 6 倍价格,而且输入超过 27.2 万后,费率会涨到 $120 和 $450。
- 区域处理。 没有 EU 节点。
- 受 TTFT 限制的调用。 我们的 GPT-6 Sol 延迟分析发现,在长时间推理中,大部分时间都花在第一个可见 token 出现之前。如果你的延迟主要在这里,先测量 Ultrafast 是否能缩短它,再决定付费。
切换之前,在 Apifox 中测量 TTFT 和总耗时
大约十分钟就能把占位值换成你自己的数字。
- 在 Apifox 中创建环境,加入
OPENAI_API_KEY。添加一个 POST 请求,指向https://api.openai.com/v1/responses,header 为Authorization: Bearer {{OPENAI_API_KEY}},body 如下:
{
"model": "gpt-6-astra",
"input": "<your real production prompt>",
"service_tier": "ultrafast",
"stream": true
}
- 复制这个请求,去掉
service_tier,作为 Standard 基线。保持 prompt 完全一致。 - 两个都发送。Apifox 会逐个事件渲染 server-sent events 流。记录第一个
response.output_text.delta到达的时间(TTFT)以及流结束的时间(总耗时);保留usage数据块——它来自最终response.completed事件——用于计算成本。 - 每个变体至少重复 10 次,比较中位数和 p95,而不是单次运行结果。
- 对于 agent 循环,要测试 WebSocket 路径:在 Apifox 中打开一个指向
wss://api.openai.com/v1/responses的 WebSocket 请求,使用相同的 header,发送一条response.create消息,字段与上面相同但不含stream,然后再发一轮,带上previous_response_id。WebSocket vs SSE 对比解释了为什么保持连接很重要。
节省的秒数等于 Standard 的中位总耗时减去 Ultrafast 的中位总耗时。把 usage 的 tokens 按两种费率分别计价,相除,再把结果与这段等待对你的成本做比较。
常见问题
OpenAI Ultrafast 是什么? 一个 Responses API 的服务层级,在 API 中以 Standard 6 倍的价格带来最高 6 倍的 token 生成速度。你可以按请求启用它,方式是设置 service_tier: "ultrafast"。
Ultrafast 是更聪明的模型吗? 不是。你调用的还是同一个 gpt-6-astra 模型 ID;改变的是速度和价格,而不是模型本身。
GPT-6 Astra Ultrafast 的价格是多少? 在短上下文下每 100 万 tokens 输入 $60、缓存输入 $6、缓存写入 $75、输出 $300,而 Standard 分别是 $10、$1、$12.50 和 $50。
“每秒 300 tokens”这个数字从哪来? 这是 OpenAI 给出的 Ultrafast 在 Codex 中的数字,那里宣称最高 8 倍。API 方面宣称的是最高 6 倍。
GPT-6.1 Sol 支持 Ultrafast 吗? 还不支持。OpenAI 表示即将推出;DevDay 2026 汇总会跟踪已上线的内容。
下一步
挑一个最慢的面向用户的请求,分别在 Standard 和 Ultrafast 下各跑 10 次,用中位数算出节省的秒数,再与额外成本做对比。在 Apifox 中把两个变体、各自的耗时和 usage 数据保存在同一个项目中。
HiFox:将 Agent 变成真正的队友
另外,我们也在思考,AI 如何从个人提效走进团队协作。
HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。
👉 立即体验 HiFox:https://hifox.com
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。