2026 年 10 月 7 日,Anthropic 正式发布 Claude Haiku 5.5,定价为每百万 token 输入 $0.10、输出 $0.50(10 万 token 以内),相比前代 Haiku 4.5 的每百万输入 $1.00、输出 $5.00,短文本场景降幅约 90%,Anthropic 官方博客称平均降幅约 75%。该模型已同步上线 Amazon Web Services、Google Cloud 和 Microsoft Azure,API 标识符为 claude-haiku-5-5。
当单次请求超过 10 万 token 时,价格立即跳升 5 倍,变为每百万输入 $0.50、输出 $2.50。Haiku 4.5 的定价是统一费率,没有任何阈值之分。这意味着,使用检索增强生成(RAG)、agent 对话历史拼接或长文档处理的团队,实际成本节省幅度将远低于标题数字。据 beri.net 报道,Haiku 5.5 的 tokenizer 将相同文本计算为比 Haiku 4.5 多约 30% 的 token,进一步压缩了实际降幅——迁移团队需要用新模型重新估算 token 消耗,而不能直接沿用旧的调用成本计算表。
定价分层的商业逻辑
Anthropic 对 Haiku 5.5 的定位表述直接:“为高频、对成本敏感的任务而设计。”这一定位在官方博客和 AWS 公告中高度一致:文档摘要、上下文压缩、数据库查询、工单分类、语音助手响应、浏览器操作机器人——这类任务的共同特征是请求量大、单次文本短、对延迟敏感,几乎不涉及超长上下文。
分层定价本质上是用定价结构强化了这一产品边界:把 Haiku 推向它真正擅长的短文本高频赛道,同时为 Sonnet 和 Opus 留出长上下文、高推理复杂度的市场空间。Haiku 5.5 在同一个月内与 Opus 5.5、Sonnet 5.5 共同构成完整的三级体系——这是 Claude 5.5 代际首次以统一版本号完成全线布局。Anthropic 同步将 Sonnet 5.5 的缓存读取价格减半,据官方称可使 Sonnet 5.5 在大多数 agent 任务中成本下降约 20%,同时为 Claude Max 和 Team 订阅用户新增每月 API 额度,鼓励在 Claude 平台上构建 agent 应用。
Haiku 5.5 还是首款引入可调努力系数(adjustable effort setting)的 Haiku 级模型,支持在低成本和高智能之间动态调整,而非对整个工作负载统一设定档位。这与 Opus 5.5 + Haiku 5.5 的双模型编排模式直接配合:Opus 负责规划和判断,Haiku 执行定义明确的高频子任务。AWS 公告中明确描述了这一模式:两者“构成强组合——Opus 5.5 规划和做判断,Haiku 5.5 快速、大规模执行定义好的任务”。
基准测试:对前代的跨代式提升
Anthropic 公布的基准测试数据显示,Haiku 5.5 对 Haiku 4.5 的性能提升幅度远超通常版本迭代的量级,接近跨代替换。在计算机使用测试 OSWorld 2.1(离线子集)中,Haiku 5.5 得分 72.4%,Haiku 4.5 仅为 15.7%,GPT-6 Luna 为 48.9%,Sonnet 5.5 为 83.9%。在专业知识工作评测 GDPval-AA v2.1 中,Haiku 5.5 的 Elo 评分为 1620,显著高于 Haiku 4.5 的 735,也超过 GPT-6 Luna 的 1437,但仍低于 Sonnet 5.5 的 1840。在专家级多学科推理测试 Humanity's Last Exam(带工具)中,Haiku 5.5 得分 57.4%,而 Haiku 4.5 仅为 18.7%,Sonnet 5.5 为 64.5%。
代码能力上,在 Terminal-Bench 4.0 的 agent 编程任务中,Haiku 5.5 得 39.2%,GPT-6 Luna 为 16.4%,Haiku 4.5 为 0.0%;在 FrontierCode 1.1 代码竞技场主榜上,Haiku 5.5 为 46.4%,GPT-6 Luna 为 42.4%,Sonnet 5.5 为 52.1%。
2026 年小模型价格战的竞争背景
Haiku 5.5 的发布落入了 2026 年 AI 推理价格持续下行的大背景中。据 shattered.io 报道,Google 此前已将 Gemini 4 Argon 的定价压至每百万输入 token $2、输出 $10;Mistral 推出了参数量 675B(其中 41B 激活参数)的 Mistral Large 4,以低成本每 token 竞争大规模推理市场。在更小模型端,多个 AI 定价分析平台的数据显示,Gemini Flash 系列和 Mistral Small 等产品的输入定价已落在 $0.10–$0.25 每百万 token 区间——Haiku 5.5 的短文本 $0.10 输入价直接进入了这一竞争带。
Haiku 5.5 与 GPT-6 Luna 的对比值得单独审视。从 Anthropic 自己发布的基准数据来看,Haiku 5.5 在计算机使用和代码 agent 任务上均超过 GPT-6 Luna——OSWorld 2.1 上分别为 72.4% 对 48.9%,Terminal-Bench 4.0 上为 39.2% 对 16.4%。但 FrontierCode 1.1 上两者差距收窄(46.4% 对 42.4%),显示在传统代码竞技场上并非全面领先。
对开发者和企业的可执行建议
对于正在评估是否迁移的团队,核心判断逻辑是:先统计你的实际 token 长度分布,再算成本。如果 95% 以上的请求在 10 万 token 以内,短文本的 90% 降幅大概率带来实质节省;如果你的工作负载包含大量 RAG 检索拼接或长会话历史,需要重新计算,10 万 token 阈值上的 5 倍溢价可能严重侵蚀账面优势。同时,tokenizer 计字效率的变化意味着在用新模型跑一批典型请求之前,任何成本估算都是不准确的。
对于企业架构选型,Opus 5.5 + Haiku 5.5 的编排模式现在有了清晰的成本逻辑支撑:将规划、判断、复杂推理放在 Opus,将定义明确的执行任务(工具调用、格式化、摘要、分类)交给 Haiku,可以在不降低整体任务质量的前提下大幅控制成本。这一模式的前提是任务分解足够清晰——如果 agent 的子任务本身边界模糊、频繁需要跨任务记忆,orchestration 开销本身就会成为新的成本来源。
对于已经在用 Haiku 4.5 的团队,迁移的代码改动相对轻量——API 标识符替换即可完成接入。但 Haiku 5.5 引入了新约束:据 beri.net 报道,新版本不再支持部分旧有的 assistant prefill 技巧,且自适应思考默认开启,需要在迁移前核查现有的 prompt 工程是否依赖这些行为。
前瞻判断
Haiku 5.5 完成了 Claude 5.5 三级体系的拼图,但更重要的信号是:Anthropic 在这一代选择用小模型降价作为发布节奏的收官动作,而不是另一个旗舰推理突破。这与 2026 年整个行业的竞争重心移动方向一致——推理能力的头部差距在收窄,成本和工程可用性成为越来越多生产决策的首要变量。
Sonnet 5.5 缓存读取减半和 Max/Team 订阅新增 API 额度,是配套的平台粘性动作:把用户的 agent 工作负载留在 Claude 生态内,而不是让他们在竞争对手低价出现时自由迁移。如果 Anthropic 下一步继续降低 Sonnet 在长上下文任务上的边际成本,那么三级定价体系就会真正覆盖从一次性对话到大规模 agent 部署的全成本曲线。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接