Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis Intelligence Index 得 56 分,仅比 Opus 5.5(max)低 2 分,max effort 下比 Sonnet 5 高 18 分。
Artificial Analysis 用自家基准拆解了性能与 token 成本的权衡,为选型提供了可对比的量化参考。
Anthropic 已发布 Claude Sonnet 5.5:它在 Artificial Analysis Intelligence Index 上得分 56,仅落后 Opus 5.5(max)2 分,但每任务输出 Token 数是我们见过的最高
在 max effort 下,Sonnet 5.5 比 Sonnet 5 提升 18 分,并在 Intelligence Index 上位列第 2,仅次于 Opus 5.5(max)。Anthropic 将 Sonnet 5.5 的定价与 Sonnet 5 保持一致,为每 100 万缓存输入/输入/输出 token $0.2/$2/$10,但它每任务输出的 Output Token 数更高,每任务成本为 $7.60(比 Sonnet 5 的每任务成本高约 50%)
关键要点:
➤ 在 agentic 终端使用和知识工作上达到领先模型水平:在 Terminal-Bench 4.0 中,Claude Sonnet 5.5 达到 64%,而 Opus 5.5 和 GPT-6 Astra 为 60%。在 AA-Briefcase(1811 对 1822 Elo)、GDPval-AA(1844 对 1846 Elo)和 AutomationBench-AA(71% 对 70% 头条分数)上,Sonnet 5.5 与 Opus 5.5 达到持平,尽管实现这一成绩的 token 使用量显著更高
➤ 我们测量到的最重 token 使用:在 max effort 下,其性能接近 Opus 5.5,Claude Sonnet 5.5 每个 Intelligence Index 任务使用约 193k Output Tokens。这是我们测量到的最高 token 使用量,比 Opus 5.5(max)或 Sonnet 5(max)高约 60%,约为 GPT-6 Astra(max)的 7 倍
➤ 定价仍为每百万输入/输出 token $2/$10,与 GPT-6 Sol 一致。按此定价,Claude Sonnet 5.5 位于 Intelligence 对 Cost per Task 帕累托前沿之外。在高 effort 水平下,它落后于 Opus 5.5,而较低 effort 下 GPT-6 Astra 或 Sol 配置能以更低成本提供同等性能。在此基础上,high effort 设置最具竞争力,在 Intelligence 上以几乎相同的 Cost per Task 略微落后于 GPT-6 Sol
➤ 在事实知识和科学推理上落后于 Opus 5.5:作为更小级别的模型,Sonnet 5.5 在 AA-Omniscience 中的事实知识上仍落后于 Opus 5.5。它的事实准确率为 54%,而 Opus 5.5 为 66%,不过幻觉率更低(47% 对 59%)。在 Humanity's Last Exam 和 SciCode 上,它也比 Opus 低约 6 分
这些评估是在 Claude Sonnet 5.5 的预发布部署上进行的,Anthropic 发现其存在一个 bug,可能会降低使用结构化输出的请求的响应质量。该问题已在公开发布版中修复,Anthropic 预计变化很小或性能略微被低估,但我们很快会重新运行相关评估。
其他模型细节:
➤ 上下文窗口:100 万 token,支持图像和文本输入,与 Sonnet 5 相同
➤ 定价:与 Sonnet 5 最新的每 100 万输入/输出 token $2/$10 相同;缓存写入 $2.5,缓存读取 $0.2
➤ Effort 设置:五种(low、medium、high、xhigh、max)。Intelligence Index 评估在全部五种设置下运行,并启用了 Anthropic 的默认回退。我们看到 Sonnet 5.5 在整个 Intelligence Index 中约 0.1% 的任务中发生回退,主要是在 TerminalBench 4.0 中,所有情况下都回退到 Sonnet 5。
来源:Artificial Analysis · x.com