Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数得 43 分,较上一代 Haiku 一年内提升 26 分。
评测方给出 Haiku 5.5 在智能指数、token 用量和多个基准上的具体数据,可与同档小模型直接对比选型。
Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分 43——在上一个 Haiku 版本发布一年后提升了 26 分
Haiku 5.5 是首个具备 Anthropic 努力设置和自适应思考的 Haiku 模型,Anthropic 还引入了分层定价。
Haiku 5.5 比其前代更便宜——对于不超过 100k tokens 的提示,每 1M 输入/输出 tokens 收费 $0.10/$0.50(与 GPT-6 Luna 相同,是上一个 Haiku 模型的 10%)。然而,超过 100k 后,这一价格会上涨 5 倍至 $0.50/$2.50。网站尚未反映分层定价,因此 Haiku 5.5 的暂定成本数据未包含这一阶梯上涨成本。我们正在开发支持,并将很快跟进 Cost per Task 覆盖。
关键要点:
➤ 领先的小型级模型性能:在最大努力下,Haiku 5.5 略微领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 Kimi K3(44)相当,后者是一个 2.8T 参数的开源权重模型,并落后 Claude Sonnet 5.5(max,56)13 分
➤ 相比 GPT-6 Luna 使用大量 tokens:Haiku 5.5(max)每个 Intelligence Index 任务使用约 162k 输出 tokens,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 提升到 max 增加 2 分,但 tokens 约为 1.8 倍。在相近智能水平下,它也使用比 GPT-6 Luna 更多的 tokens:Haiku 5.5(high)得分 38,每任务约 55k tokens,而 Luna(max)得分 38,约 50k tokens,且在更低努力设置下差距扩大
➤ 在智能体知识工作方面能力很强:在 AA-Briefcase 上,这是我们针对现实知识工作任务的私有评估,Haiku 5.5(max)达到 1578 Elo,领先于包括 Kimi K3 和 GLM-5.3 在内的模型,并与 Muse Spark 1.3(max)相当
➤ 终端使用方面的改进:在 Terminal-Bench 4.0 上得分 33%,高于 Haiku 4.5 的 0%。这与 GLM-5.3 Flash 持平,并领先 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)
➤ 事实知识较低,但幻觉相对较少:正如较小级别模型所预期,Haiku 5.5 的事实知识低于其同系列模型。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44%,但这在一定程度上是因为它更愿意承认自己不知道——其幻觉率为 40%,低于 55% 和 77%
➤ AutomationBench-AA 结果可能被低估:Haiku 5.5 得分 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在发布前测试中,一个安全拒绝问题导致模型过度拒绝。Anthropic 正在解决这一问题——我们将在修复后重新运行此评估,并预计该分数会上升
其他模型细节:
➤ 上下文窗口:1 million tokens,高于 Claude 4.5 Haiku 的 200k
➤ 定价:每 1M 输入/输出 tokens 在不超过 100k tokens 时为 $0.10/$0.50,超过后为 $0.50/$2.50。缓存读取 $0.01(超过 100k 为 $0.05),5 分钟缓存写入 $0.125(超过 100k 为 $0.625)
➤ 多模态:文本和图像输入,文本输出
来源:Artificial Analysis · x.com