Today for AI

Hacker News AI · 2026/10/7 18:01:32

Anthropic 发布 Claude Haiku 5.5:成本降 75% 并优化 Sonnet 缓存定价

原标题:Claude Haiku 5.5
78AI 研判分
核心综述

Anthropic 推出最新小模型 Claude Haiku 5.5,主打高吞吐与低成本场景,运行成本较前代降低约 75%,并作为 Opus/Sonnet 的编码子代理。同时,Sonnet 5.5 的缓存读取价格减半,使大多数智能体工作负载成本降低约 20%,进一步巩固其性价比优势。

报道全文原始报道全文

本文目录6 个章节

Claude Haiku 5.5 正式发布:这是我们迄今推出的最便宜、速度最快且能力最强的小型模型。

Claude Haiku 5.5 专为高吞吐量、成本敏感型任务而设计。它能可靠地处理快速且重复性的工作负载(如摘要生成、上下文压缩、数据库查询和分类请求)。在编码工作中,它可与 Opus 5.5 和 Sonnet 5.5 配合使用,作为子代理运行。此外,由于它也是我们目前速度最快的模型,因此特别适用于对速度要求较高的任务,例如实时客户支持和浏览器操作。¹

Haiku 5.5 的价格远低于 Haiku 4.5。平均而言,其运行成本降低了约 75%。²

随着此次发布,我们也在提升整个模型系列的性价比。我们将 Claude Sonnet 5.5 的缓存读取价格减半,这意味着在大多数代理式工作负载中,Sonnet 5.5 的运行成本降低约 20%。同时,我们为 Claude Max 和 Team 订阅用户推出了新的月度 API 额度,旨在支持用户在 Claude 平台上构建新的代理和应用程序。

性能

以下是 Claude Haiku 5.5 在一系列基准测试中的表现:

Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5For reference
Knowledge workGDPval-AA v2.1
Knowledge workGDPval-AA v2.1162073514371840
Knowledge workAA-Briefcase v1.1
Knowledge workAA-Briefcase v1.1157861413361824
Computer useOSWorld 2.1
Computer useOSWorld 2.172.4%Offline subset15.7%Offline subset48.9%Offline subset83.9%Offline subset
Multidisciplinary reasoningHumanity’s Last Exam
Multidisciplinary reasoningHumanity’s Last Exam45.9%no tools10.2%no tools—56.9%no tools
57.4%with tools18.7%with tools—64.5%with tools
Agentic codingTerminal-Bench 4.0
Agentic codingTerminal-Bench 4.039.2%0.0%16.4%70.6%
Agentic codingFrontierCode 1.1 (Main)
Agentic codingFrontierCode 1.1 (Main)46.4%—42.4%52.1%Xhigh
Visual reasoningChartography
Visual reasoningChartography46.4%no tools6.4%no tools29.1%no tools61.6%no tools

有关我们如何执行评估的详细信息,请参阅 Haiku 5.5 System Card。

Haiku 5.5 是我们首款支持可调节“努力程度”(effort)设置的 Haiku 级模型。这意味着,与我们的其他模型一样,用户可以在成本优化和智能表现之间做出权衡。下图展示了 Haiku 5.5 在不同努力程度设置下,在三个基准测试中的表现:

计算机使用:OSWorld 知识工作:GDPval-AA 多学科推理:人类最后的考试(Humanity’s Last Exam)

OSWorld 2.1(离线子集) 准确率 vs. 成本

OSWorld 2.1 衡量的是智能体操作真实计算机以完成长周期、多步骤任务的能力。

GDPval-AA v2.1 准确率 vs. 成本

Artificial Analysis 的 GDPval-AA v2.1 评估智能体在涵盖 44 种职业的真实世界专业工作中的表现。

人类最后的考试(无工具辅助) 准确率 vs. 成本

人类最后的考试(HLE)是一项测试专家级学术知识和推理能力的基准。

在早期测试中,我们的客户反馈的结果与上述性能和成本改进一致。以下是他们关于新模型的反馈:

Asana HubSpot AlphaSense Box Rogo Cognition

“我们对 Claude Haiku 5.5 印象深刻,尤其是其速度。我们在 AI Teammates(我们的 AI 智能体产品)的评估套件中运行了该模型,涵盖了缺陷分类、项目设置以及搜索大型投资组合以发现高风险或逾期工作等用例。与我们目前使用的模型相比,任务完成的延迟降低了 30% 以上,每个智能体回合的推理速度提升了高达 2.5 倍。用户体验明显更加流畅。”

公司:Asana 作者:Aaron Vinh, Staff Software Engineer

“在 HubSpot,我们使用模拟门户来评估新模型在 CRM 任务(如交易报告)上的表现。我们主要测试更小、更高效的模型,而 Claude Haiku 5.5 在该套件上取得了我们迄今看到的最高分,三次运行的平均得分为 92.8%。其中一项 CRM 审计任务要求模型识别陈旧但模糊的记录。在我们测试的所有模型中,Haiku 5.5 完成任务的速度最快,命中率最高,且误报率最低。”

公司:HubSpot 作者:Ze’ev Klapow, Distinguished Software Engineer

“Ask in Document 是我们的主要支出来源之一,在生产环境中每周处理约 800 万次调用。它针对一个或几个文档回答非常具体的问题。我们运行了 400 个查询,Claude Haiku 5.5 相比 Haiku 4.5 有统计显著的提升:得分从 0.76 提升至 0.84。”

公司:AlphaSense 作者:Daniel Campos, Distinguished Engineer

“我们的客户在海量企业内容中使用 Box AI。随着使用范围的扩大,我们需要管理效率和成本,并为当前任务找到最合适的模型。在早期测试中,Claude Haiku 5.5 的得分比 Haiku 4.5 高出 11 分,而延迟仅约为后者的一半。我们将把它用于大规模运行的分析工作,从成本报告到财务摘要以及每周定期审查。”

CompanyBoxAuthorYashodha Bhavnani, VP of AI ProductsQuote

“对于简短且高并发的任务,Claude Haiku 5.5 非常适合我们,例如快速查询、子代理(subagents)和摘要生成。当更大的模型构建演示文稿时,Haiku 5.5 子代理会深入查阅 10-K 文件,提取演示文稿所需的分部营收数据。其准确性足以让我们放心使用,而且速度快、成本低,因此我们可以频繁运行它。”

CompanyRogoAuthorAlex Wang, Applied AIQuote

“Claude Haiku 5.5 作为优秀选项加入了 Devin Fusion 的副手(sidekick)阵容。借助 Haiku 5.5 作为副手,Fusion 保持了顶尖的 FrontierCode 得分 66.2,同时降低了成本和延迟。你今天就可以在 Devin CLI 中尝试它,并以 Opus 5.5 作为主导模型。”

CompanyCognitionAuthorWalden Yan, Co-Founder & CPO

定价

下表展示了 Claude Haiku 5.5 的定价与我们其他模型的对比情况。当用于提示词长度不超过 100,000 tokens 的任务时,Haiku 5.5 具有极高的性价比,这类请求约占我们上一代 Haiku 模型总请求量的 90%。

每百万 tokens 价格Haiku 5.5 提示词 ≤ / > 100kHaiku 4.5Sonnet 5.5
缓存读取 (Cache reads)0.01/0.01 / 0.05$0.10$0.10
缓存写入 (Cache writes)0.125/0.125 / 0.625$1.25$2.50
输入 tokens0.10/0.10 / 0.50$1.00$2.00
输出 tokens0.50/0.50 / 2.50$5.00$10.00

安全性

对齐性 (Alignment). 与 Haiku 4.5 相比,Claude Haiku 5.5 在我们几乎所有对齐评估中都显示出显著改进。具体而言,我们发现不对齐行为的情况大幅减少,且配合滥用行为的意愿更低。该模型的 系统卡 更详细地描述了我们的评估过程和结果。

安全防护。 与其能力相匹配,Haiku 5.5 的网络安全防护比 Haiku 4.5 更严格,但比我们应用于其他近期模型的防护略宽松。在网络安全方面,它们允许比 Sonnet 5.5 的防护措施更广泛的防御性任务,但仍会阻止渗透测试及其他更可能被攻击者使用的技术。

Haiku 5.5 的生物学防护措施与 Sonnet 5、Sonnet 5.5 和 Opus 5 相同。它们允许研究性的生物学问题,但限制访问那些我们判断可能造成危害的请求。从事更广泛生物学和网络活动的组织可以申请加入我们的生命科学验证计划和网络验证计划。

可用性

Claude Haiku 5.5 现已在所有平台上可用,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude Platform 上,开发者可以通过 claude-haiku-5-5 开始使用。

详情参见我们的迁移指南。

进一步更新

除了为 Claude Haiku 5.5 推出新定价外,我们还在进一步提升模型和产品的价值。

首先,从今天起,我们将降低 Claude Sonnet 5.5 的缓存读取价格。缓存读取费用现在降低了 50%:每百万 token 从 0.20降至0.20 降至 0.10。由于缓存读取占据了模型 token 消耗的很大一部分,这使得 Sonnet 5.5 在大多数 agentic 任务上的成本降低了约 20%。

例如,以下是降价对 Sonnet 5.5 在 Terminal-Bench 4.0 中性能与成本关系的影响:

Terminal-Bench 4.0Accuracy vs. cost

Terminal-Bench 4.0 衡量模型在命令行界面中完成复杂多步骤专业任务的能力。

该图表展示了 Haiku 5.5 与我们更大规模模型之间的一个重要区别。对于像 Terminal-Bench 4.0 所衡量的复杂 agentic 编码任务,Sonnet 5.5 和 Opus 5.5 仍然是更好的选择。相比之下,Haiku 5.5 最适合范围较窄的任务,这些任务如果使用之前版本的 Claude 可能会因成本过高而难以实施——例如压缩(compaction)、摘要或子代理(subagent)工作。

其次,本周我们将向所有 Max 和 Team 订阅用户推出每月新的 API 积分,用于 Claude Platform。Max 5x 用户每月将获得 100的积分,Max20x用户将获得100 的积分,Max 20x 用户将获得 200,Team 订阅用户最多可获得 $500(由团队内所有用户共享)。这些积分旨在让用户能够尝试构建调用我们 API 的工具、应用和智能体。这些积分可用于我们的任何模型。更多信息请参阅我们的帮助中心文章。

对于开发者,我们还更新了 Claude Python 和 TypeScript SDK,以在 beta 版本中添加对计算机使用和浏览器使用的支持。鉴于 Haiku 5.5 在速度、能力和价格方面的综合优势,它特别适合此类任务。你可以在我们的 Claude Platform 文档中阅读更多相关内容。

脚注

1 Claude Haiku 5.5 是我们迄今为止在每个模型标准速度下最快的模型,尽管它在 Fast Mode(快速模式)下的运行速度不如我们的 Opus 模型快。

2 对于不超过 100,000 tokens 的请求,Claude Haiku 5.5 的价格比 Claude Haiku 4.5 低 90%;对于超过 100,000 tokens 的请求,价格低 50%。在 Haiku 4.5 上,90% 的请求属于前一种情况。此计算还考虑了 Haiku 4.5 和 Haiku 5.5 在完成特定任务时所用 token 数量的变化:Haiku 5.5 采用了更新的 tokenizer(与 Sonnet 5.5 和 Opus 5.5 类似),这意味着每个任务使用的 token 数量略多。