摘要:Anthropic 于 2026 年 10 月 7 日发布 Claude Haiku 5.5(模型 ID:claude-haiku-5-5),AWS、Google Cloud、Microsoft Azure 与 Claude Platform 同步上线。10 万 tokens 以内的请求,输入价格从 Haiku 4.5 的每百万 1 美元降到 0.1 美元,输出从 5 美元降到 0.5 美元,官方称平均降价约 75%。这是 Haiku 系列第一个支持 effort 档位调节(Low 到 Max)的型号,官方明确把它定位成编码子代理。本文说清价格结构、基准数据怎么看,以及把它接进现有代理工作流要注意什么。
如果你跑过多代理工作流,对这笔账不会陌生:主代理用旗舰模型做规划,几十个子任务——跑测试、审 diff、整理变更说明——全走旗舰模型,一个晚上能烧掉几十美元;换成便宜的小模型,又常常在工具调用和长任务上掉链子。上一个 Haiku 4.5 在 Terminal-Bench 4.0 上的得分是 0.0%,这个零分意味着它当时几乎接不下真实终端任务,只能做一些纯文本处理。Haiku 5.5 想回答的正是这个问题:小模型的"便宜"和"够用"能不能同时成立。
发生了什么:10 月 7 日全平台上线
10 月 7 日,Anthropic 正式发布 Claude Haiku 5.5,ID 为 claude-haiku-5-5,四家平台全部可用。三个变化最值得注意。第一,它是 Haiku 系列第一个支持 effort 档位调节的型号,可以在 Low 到 Max 之间选择推理投入。第二,它换用了与 Sonnet 5.5、Opus 5.5 一致的新 tokenizer,代价是同样任务的 token 用量略有增加。第三,Python 与 TypeScript SDK 同步加入 computer-use 与 browser-use 的 Beta 支持——这在 Haiku 档位是第一次。官方还给它挂了一个头衔:标准速度档下 Anthropic 最快的模型。
价格怎么变:以 10 万 tokens 为界分两档

这次定价以 prompt 长度 10 万 tokens 为界分成两档:不超过 10 万时,输入每百万 0.1 美元、输出 0.5 美元、缓存写入 0.125 美元、缓存读取 0.01 美元;超过 10 万则分别为 0.5、2.5、0.625 和 0.05 美元。也就是说,10 万以内输入输出都是 Haiku 4.5 的一折,超过之后是半价。Anthropic 给出的依据是:此前约 90% 的 Haiku 请求 prompt 都在 10 万 tokens 以内(厂商自述数据)。同一天,Sonnet 5.5 的缓存读取价格下调一半至每百万 0.1 美元,官方估计多数代理工作流的整体成本能降约 20%。订阅侧,Max 5x 与 Max 20x 档每月分别获得 100 美元和 200 美元 API 额度,Team 档可共享的额度池最高 500 美元。
基准数据怎么看:官方四组对比
官方给出的对比里,四组数字最能说明代际差异。通用办公基准 GDPval-AA v2.1 上,Haiku 5.5 拿到 1620 分,上一代只有 735 分,正好落在 GPT-6 Luna(1437)与 Sonnet 5.5(1840)之间;同为办公文档任务的 AA-Briefcase v1.1 从 614 分跃升到 1578 分。Humanity's Last Exam 不挂工具时从 10.2% 提高到 45.9%,挂上工具后是 57.4%,同条件的 Sonnet 5.5 为 64.5%。图表理解基准 Chartography 从 6.4% 提到 46.4%。把这四组放在一起看,Haiku 5.5 与旗舰的差距主要剩在高难推理和超长任务上,日常文档与代码审查类任务已经进入同一量级——这正是子代理场景最需要的那一段。
完整工作场景:把代码审查子代理换成 Haiku 5.5
设想一个日常场景:主会话用 Sonnet 5.5 或 Opus 5.5 做架构判断,每次提交后拉起的子代理负责跑测试、审 diff、总结变更。把子代理整体换成 Haiku 5.5 后,按 10 万档输出价计算,同样的审查任务输出花费是原来的一成;即便新 tokenizer 让 token 数略增,账仍然好算。更省的是上下文:子代理的系统提示和代码库摘要每轮都相同,缓存读取只要每百万 0.01 美元,一个十轮的审查会话,上下文开销可以压到几美分。编码基准上,官方数据显示 Terminal-Bench 4.0 得分 39.2%(Haiku 4.5 为 0.0%),FrontierCode 1.1 Main 拿到 46.4%,高于 GPT-6 Luna 的 42.4%,仍低于 Sonnet 5.5 在 Xhigh 档的 52.1%;OSWorld 2.1 离线子集从 15.7% 提到 72.4%。操作层没有任何新依赖:Claude Code 里把子代理模型设为 claude-haiku-5-5 即可,Cognition 也已把它接进 Devin CLI 与 Devin Fusion。审查中发现需要跨文件重构的问题,再升级回主会话处理。
为什么这改变工作流
过去选小模型是在"省钱"和"能干"之间妥协。这次真正值得注意的信号是:Anthropic 把 effort 调节下放到 Haiku 档,等于承认子代理也需要"用力程度"这个旋钮,而不是一刀切的轻量模型。10 万 tokens 的定价分界还透露了一个产品事实——绝大多数真实请求用不到超长上下文,为长上下文付的溢价这次被显式标了出来。对开发者来说,重新核算代理集群成本的时间点就是现在:子任务迁到 Haiku 5.5、主代理保持旗舰,是当下最直接的省钱路径。还有一个容易忽略的变化:Sonnet 5.5 缓存读取同日降价一半,意味着主代理那段长系统提示和代码库上下文的账单也在同步下降,两条线加起来,代理工作流的成本结构这次是整体下移。
限制与需要人接管的点
几个边界要交代清楚。上下文窗口与速率限制官方没有公布,迁移前最好用真实流量压测;文中基准全部为厂商自报,横向对比要以自己的任务复测为准;新 tokenizer 会让单任务 token 略增,实际降幅达不到名义上的九成;网络安全防护比 Haiku 4.5 更严格,渗透测试类请求仍会被拦截,生物安全防护则与 Sonnet 5/5.5、Opus 5 同级;数据保留政策的细节官方没有一并公布;在 Fast Mode 下它也不比 Opus 快——标准速度才是它的最快档。代码审查的最终合并判断,仍然应该留在人或旗舰模型这一层。
如何试用
四个平台开箱即用:把模型 ID 换成 claude-haiku-5-5 即可;要在自建代理里用上 computer-use 与 browser-use Beta,需要升级到最新的 Python 或 TypeScript SDK;Max 与 Team 订阅用户记得在后台确认本月 API 额度到账。Vercel AI Gateway 也已在 10 月 7 日同步接入该型号,走网关路由的团队同样按这两档价格计费。另外提醒一句:新 tokenizer 与 5.5 系列对齐,混用旧型号做 token 统计和成本对比时,数字不再直接可比。
信息来源
- Anthropic 官方公告:Introducing Claude Haiku 5.5(2026-10-07)
- Vercel Changelog:Claude Haiku 5.5 now available on AI Gateway(2026-10-07)
HiFox:将 Agent 变成真正的队友
另外,我们也在思考,AI 如何从个人提效走进团队协作。
HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。
👉 立即体验 HiFox:https://hifox.com
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。