GPT-6 Astra 最瞩目的特性是能够操作电脑。这可不是 2025 年那种在演示视频里点几下鼠标、遇到下拉菜单就卡住的程度。根据 OpenAI 发布日志 的数据,Astra 在 OSWorld 2.0 上的得分为 72.6%(平均每个任务耗时约 40 分钟),不仅能填写表单、更新 CRM 数据、安装软件,还能对自己构建的网站运行前端 QA 检查。OpenAI 称其为“全球最佳电脑操作模型(the world’s best computer use model)”,而这次的演示效果确实名副其实。
如果你负责开发或测试 API,这项能力看似提供了一条诱人的捷径:直接把 Astra 对准你的应用,让它自己去点击操作。但本文认为,你应该选择一种看起来没那么炫酷、但更加实用的做法:直接把契约交给它。相比于屏幕界面,OpenAPI 规范对模型而言是一种更快、更低成本且更容易校验的接口,而像 Astra 这样强大的模型完全能很好地利用它。在我们为期两天的实测中,我们观察到 Astra 自身也主动做出了这种切换。本文接下来的内容将解释为什么这是正确的选择,以及如何利用 Apifox 来完成配置。
TL;DR
GPT-6 Astra 的电脑操控能力毋庸置疑:在 OSWorld 2.0 上取得 72.6% 的成绩,在 ScreenSpot-Pro 上达到 92.7%,并且全新的 Codex harness 框架让电脑操控任务的完成速度比 GPT-5.6 Sol 快了 1.9 倍。然而,通过屏幕驱动操作每个任务需要耗费数十分钟和大量图片 Token,且测试的是 UI 而非 API。对于你自己的服务,建议通过 Apifox MCP Server 或函数工具的形式将 OpenAPI 规范提供给 Astra,让它来编写测试场景,并通过 Apifox CLI 在 CI 中运行。将电脑操控能力留给那些没有 API 的界面。
GPT-6 Astra 的电脑操控能力可以做到什么
这项能力远不止“浏览网站”这么简单。OpenAI 列举的场景包括繁琐的知识性工作(在线表单、CRM 记录、日历管理)、在文档编辑器中进行调研与起草、带有图表的科学数据分析、通过 ChatGPT Sites 构建并托管网站,以及对该网站进行前端 QA 测试。演示样例中甚至还包含了在 KiCad 中布局印制电路板,以及在 Blender 中进行房屋 3D 建模。
基准测试数据如下(均来自 OpenAI 发布日志中的测试结果):
| 基准测试 | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0(离线测试集,部分得分) | 72.6%(约 40 分钟/任务) | 65.7%(约 75 分钟/任务) | 70.2% |
| ScreenSpot-Pro(无工具) | 92.7% | 76.9% | - |
| Agents’ Last Exam | 59.3% | 53.6% | 55.5% |
| AutomationBench | 41.4% | 18.1% | 26.9% |
比起单纯的分数,有两个细节更值得关注。首先,Astra 完成 OSWorld 任务所需的时间比 Sol 减少了约 47%;其次,在最高得分设置下,Astra 在 Agents’ Last Exam 上的输出 Token 消耗比 Opus 5 少了约 65%。除了模型本身,OpenAI 还更新了 Codex harness 框架,使其在 Mind2Web 上的电脑操控任务完成速度比当前的 Sol 体验提升了 1.9 倍。更快的循环意味着更低的成本,这对于按 Token 付费的用户来说才是最核心的。

行为表现也有所提升。Astra 仅在回答会改变结果时才提出针对性的问题;当你在任务中途调整方向时,它能保持方向明确;在 Codex 中,它甚至可以在等待你回复的同时,异步继续执行不依赖该回复的其他工作。在 OpenAI 内部的 computer-use 安全基准测试中(得分越低越好),Astra 的得分为 2.4%,而 Sol 为 22.0%。
一个 40 分钟任务的成本
Computer use 是一个循环:截图、推理、操作、再次截图。每张截图都是图像输入,每一步都携带着截至目前的完整对话历史,而一个耗时 40 分钟的任务会包含数百个步骤。按照 Astra 每百万输入 token 10 美元、每百万输出 token 50 美元的标准费率,以及超过 272K 输入 token 的 prompt 按每百万 20 美元计费的规则,一个在上下文中保留完整历史的长会话在结束之前就会进入长上下文计费区间。Prompt 缓存(每百万缓存 token 1 美元)虽然有助于处理重复的前缀,但截图本身在每一步都是全新的。
将其与基于契约的方式进行对比:你的 OpenAPI 规范是一个前缀,只需缓存一次。模型编写的每个测试只有几百个 token 的 JSON。该测试的每次运行都是一次 HTTP 请求,在模型端不会产生任何费用,因为测试场景一旦编写完成,就不再需要模型参与执行。
还有第二种与资金无关的成本。OpenAI 的安全概述指出,其生产环境中的对齐偏离监控器“有时可能会减缓、暂停或终止合法的工作”,并特别提到了“Agent 长时间运行的任务”。在 ChatGPT 或 Codex 中,系统会提示你审查该操作;而在 API 中,任务会直接停止。一个耗时 40 分钟的屏幕操作会话,恰恰是最容易受到这种中断影响的任务形态。而一个 5 秒钟的 API 请求则不会。
Computer use 与契约对比:各自的最佳适用场景
| 场景 | 推荐工具 | 原因 |
|---|---|---|
| 测试你自己的 API | 接口规范 | 结果确定、重跑成本低,针对实际契约进行断言 |
| CI 中的回归测试套件 | 接口规范 | 测试场景运行无需模型参与 |
| 没有 API 的第三方门户网站 | Computer use | 没有可交付的契约 |
| 发布前端到端的 UI/前端 QA | Computer use | UI 本身就是被测对象 |
| 遗留的桌面端工具 | Computer use | 只有屏幕界面存在 |
| 检查文档与实际行为是否一致 | 接口规范,然后是 UI | 发送文档中记录的请求,对比响应,然后抽查渲染后的页面 |
核心区别在于你在测试什么。Computer use 测试的是像素;而接口规范测试的是承诺。当前端挂掉时,API 通常依然正常;而当 API 挂掉时,前端可能会用友好的错误提示将其掩盖。两者都很重要,但 API 团队交付的是承诺,因此应该优先测试承诺。
如何将 API 契约交付给 Astra
将接口规范提供给 Astra 有三种方式,且这三种方式可以叠加使用。
1. 提供文件。 从你的 Apifox 项目中导出 OpenAPI 规范(或者先将现有的规范导入到 Apifox 中),并将其包含在请求中。Astra 拥有 1,050,000 个 Token 的上下文窗口,可以在单个 prompt 中容纳任何实际场景下的接口规范。OpenAI 的 MRCR 检索测试表明,在 512K 到 1M 范围内,Astra 能保持 96.3% 的准确率,而 Sol 则降至 73.8%。大型规范不再是分块(chunking)难题。
2. 通过 MCP 连接项目。 Apifox MCP Server 可以将你的 Apifox 项目、已发布的文档或 OpenAPI 文件暴露给任何支持 MCP 的客户端,从而使 Astra 读取的是最新的契约,而不是过期的导出文件。Codex 和桌面端 Agent 可以在工作时直接拉取接口定义。正是这种配置让 Astra 在我们的测试中能够自主找到并读取规范。
3. 将规范转换为工具。 对于程序化使用,可以将接口转换为函数工具,并通过 Responses API 调用 Astra,这就是我们在“从 OpenAPI 到 AI Agent 工具”中涵盖的模式。模型页面 列出了 Astra 支持的 function calling、structured outputs 和 file search 等特性,而且工具调用(tool calling)需要使用 Responses API,而非 Chat Completions。
要求 Astra 根据规范草拟测试场景的最小化请求如下所示:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
来自 OpenAI 模型指南 的两点提示:Astra 没有 none 或 minimal 级别的 effort,因此请从 low 或 medium 开始;此外,它比早期模型“更容易寻求澄清”,因此 developer 消息中的“bias towards action”(倾向于直接行动)这句话起到了关键作用。
4. 无需模型参与即可运行测试场景。 将生成的测试场景导入 Apifox,添加对状态码和响应数据模型的断言,并在流水线中使用 Apifox CLI 运行它们。模型只需编写一次测试,你的 CI 就能免费运行成千上万次。这就是用一句话概括的成本优势,也是为什么在这个工作流中,下载 Apifox 与 API key 同样重要。
即使 Astra 会遵循规则,也要保留安全防护
OpenAI 为 Astra 发布的安全对齐(alignment)测试结果是其有史以来最好的。在 Hugging Face 事件后构建的蜜罐测试中,Sol 有 48% 的概率超出了授权目标,而 Astra 的这一比例为 0%。即便 Codex 自动审核拒绝策略被故意配置为可绕过,Astra 也从未尝试过绕过它。其针对间接提示词注入的鲁棒性达到了 99.79%,高于先前的 96.23%。
但这并不意味着不再需要卡点机制(gates),只是意味着卡点被触发的频率降低了。一个拥有 100 万 Token 上下文窗口、网络安全评估等级达到“致命”(Critical)、且能够向你的 API 发送任意请求的模型,仍应在预发环境(staging)中运行,并配合受限作用域的凭证、针对数据变更操作的审批卡点以及全量调用的链路追踪。Astra 的监控器也可能在任务执行中途停止运行,因此请将每个长任务都设计为可恢复的。非确定性 Agent 的测试设计依然适用:针对契约(contract)进行断言,而不是针对执行轨迹断言。
Computer Use 依然不可替代的场景
不要将其误解为“绝不让它进行点击操作”。有三种场景在屏幕(UI)界面上处理效果更好:一是没有 API 的合作伙伴门户网站或管理员控制台;二是发布当天原本需要人工手动进行的前端检查;三是 UI 为唯一交互界面的老旧桌面工具。Astra 是第一个让这些工作完全值得委托处理的模型,而 Codex harness 带来的速度提升使得每晚运行这些任务的成本足够低廉。
实用原则:存在接口契约时,优先使用契约;不存在契约时,再选择屏幕操作。
FAQ
GPT-6 Astra 的 computer use 功能是否可以通过 API 配合工作? 是的。Computer use 与网络搜索、文件搜索、代码解释器(code interpreter)以及图像生成一起列在 Responses API 支持的 Astra 工具列表中。你的应用程序负责提供环境,并执行模型建议的操作。该 API 还引入了 OpenAI 更严格的安全保障机制:被对齐偏离监控器暂停的任务会直接停止运行,而不是等待人工审核。
我可以给它多大规模的规范文档(spec)? 上下文窗口为 1,050,000 Token,输出限制为 128,000 Token。一份包含数百个接口和完整数据模型的规范文档可以轻松装下,且尚有富余。超过 272K 输入 Token 的 Prompt 将按输入和缓存费率的 2 倍计费,因此建议缓存规范前缀,并保持单次测试的消息体较小。
它是否会幻觉出规范(spec)中不存在的接口? 概率比之前的模型低得多。在 OpenAI 的内部幻觉基准测试中(数值越低越好),Astra 为 4.2%,而 Sol 为 12.2%,且 Astra 歪曲自身能力的可能性降低了三倍。结构化输出配合在 Apifox 中进行的数据模型校验运行可以拦截其余的幻觉情况,这也是为什么契约测试才是最终标准,而不是模型本身。
在测试生成方面,这比 GPT-5.6 Sol 更便宜吗? 如果按 token 算,并不是。Astra 的价格是每百万 token 10 美元和 50 美元,而 Sol 的促销价为 4 美元和 20 美元。但如果按完成的任务计算,OpenAI 声称 Astra 消耗的 token 要少得多,而且规范优先的工作流使得模型成本成为一次性开销。在做出决定之前,请根据你自己的规范进行测试评估;API 指南展示了如何将两者进行并排对比。
简而言之
GPT-6 Astra 可以操作你的电脑,对于没有 API 的界面来说,这确实是个巨大的福利。但对于你自己拥有的 API,通过屏幕进行交互只是一条低效的路径。将 API 契约交给模型,让它编写测试场景,在 CI 中运行它们,并把好质量关。Astra 在不到二十分钟的时间里自己得出了这一结论。你的团队现在就可以从这里开始。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会