Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上、多数任务成本降低 30%
Claude Sonnet 5.5
Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出速度比 Sonnet 5 快 30% 以上,多数任务成本最高降低 30%,定价保持每百万输入 token $2、输出 token $10。
官方给出多组基准对比和定价,读者可以判断 Sonnet 5.5 在速度与成本上对 Opus 5.5 的互补定位。
隆重推出 Claude Sonnet 5.5,这是 Claude 5.5 家族中的第二款模型。相比 Claude Sonnet 5 是一次明显的升级,运行速度提升 30% 以上,且大多数工作的成本最多可降低 30%。
Sonnet 5.5 是 Claude Opus 5.5 更快、成本更低的补充。Opus 5.5 专为需要审慎判断的复杂工作而打造,而 Sonnet 5.5 最擅长范围明确的日常任务、修复 bug,以及制作精美的文档、幻灯片和电子表格。它对设计也有敏锐的眼光。专为高并发和成本敏感型应用打造的 Claude Haiku 5.5 将在未来几周内加入 Claude 5.5 家族。
Sonnet 5.5 相比 Sonnet 5 在以下方面有所提升:
性能。Sonnet 5.5 在 Terminal-Bench 4.0 这一智能体编程评测中得分 70.6%,而 Sonnet 5 为 10.3%。在 GDPval-AA 这一测试多种职业真实工作表现的评测中,它比 Opus 5.5 低两分。它在长周期任务和图像理解方面表现强劲——它是首个仅凭截图就能通关 Pokémon Red 的 Sonnet 模型。
协作。与 Opus 5.5 一样,Sonnet 5.5 比我们上一代模型写得更清晰;早期测试者称它比 Sonnet 5 更适合作为协作伙伴。它的速度也使其非常适合在不太复杂的任务上快速迭代。
成本。Sonnet 5.5 的定价与 Sonnet 5 相同,每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 token 0.20 美元,但完成同样的工作通常需要的 token 少得多。在我们的测试中,它每个任务的成本比前代最多低 30%。
速度。Sonnet 5.5 生成输出的速度比 Sonnet 5 快 30% 以上,是我们迄今为止最快的 Sonnet 模型。
对齐与安全。在我们的自动化行为审计中,Sonnet 5.5 在大多数对齐指标上优于或持平 Sonnet 5。由于其网络安全能力与 Opus 5 相当,它是首个在发布时配备网络安全防护和回退机制的 Sonnet 模型,与我们为最强模型所开发的机制类似。其生物安全防护与 Sonnet 5 相同。这两项防护都针对一小部分高风险请求;常规软件开发和大多数生命科学工作不受影响。
性能
Sonnet 5.5 在各领域都优于 Sonnet 5——某些情况下提升显著。在多项评测中,以 Max 强度运行的 Sonnet 5.5 甚至能与 Opus 5.5 表现相当。然而,基准分数只反映模型能力的一个侧面;在我们自己的测试以及外部测试者的测试中,Opus 5.5 在需要持续判断的复杂、开放式工作上仍然明显更强。
| Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol | |
|---|---|---|---|---|
| 智能体编程Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | — |
| 智能体编程FrontierCode 1.1 (Main) | 46.2%Max² | 42.4% | 54.4% | 49.3% |
| 52.1%Xhigh | ||||
| 智能体编程CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| 知识工作GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| 知识工作AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| 多学科推理Humanity’s Last Exam | 64.5%使用工具 | 54.9%使用工具 | 67.7%使用工具 | — |
| 计算机使用OSWorld 2.1 | 80.1%部分 | 57.0%部分 | 81.8%部分 | — |
| 可视化图表识别Chartography | 61.6%无工具 | 15.6%无工具 | 64.4%无工具 | 53.6%⁴无工具 |
关于我们如何运行评估的详细信息,请参阅 Sonnet 5.5 System Card。
下面的图表将每个模型在每种 effort 级别下的得分与其每任务成本进行对比。随着 effort 提高,模型通常工作更长时间,导致每任务成本更高,但通常得分也更高。点越靠近图表的左上角,其每美元所提供的能力就越强。
在多项基准测试中,Sonnet 5.5 在 Low 或 Medium effort 下的表现超过了 Sonnet 5 的最佳得分,而每任务成本仅约为其十分之一。在较低的 effort 设置下运行时,它与 Opus 5.5 形成最佳互补,此时每任务成本更低。在较高设置下,它也能以相近的成本实现相当的表现。
010203040506070得分 (%)12510每次尝试成本(美元,对数刻度)
Terminal-Bench 4.0 衡量模型在命令行界面内完成复杂、多步骤专业任务的能力。在 Medium effort(Claude 应用中的默认设置)下,Sonnet 5.5 远超 Sonnet 5 的最佳得分,而每任务成本不到其十分之一。
Terminal-Bench 和 OpenAI 未公开报告 GPT-6 Sol 的表现,因此我们在此报告 GPT-5.6 Sol。
编程
Sonnet 5.5 的性能跃升在编程方面尤为明显。在 FrontierCode 上以 High effort 运行时,它的得分比相同设置下的 Sonnet 5 高 10 分,而每任务成本约为其十五分之一。在 CursorBench(该基准测试模型处理来自真实 Cursor 编程会话的任务)上,其最佳得分与 Opus 5.5 相差约两分以内。
早期测试者赞赏 Sonnet 5.5 理解代码库的速度之快。他们也对其效率印象深刻:在正面交锋的运行中,它比 Sonnet 5 更多地将工具调用批量合并,从而减少了步骤并降低了成本。
引述
“在 Epic 的早期测试中,Claude Sonnet 5.5 达到了你对更高层级模型所期望的同等质量水准,在系统设计审计和数据流审查中表现稳健。新模型管理了游戏系统架构中数万行代码,保持响应迅速,处理了长达数小时的任务,并且只需较少的明确提示即可交付。”
公司Epic Games
作者Daniel Vogel,首席运营官
知识工作
Sonnet 5.5 在知识工作的多个领域都有提升。在 GDPval-AA(该基准测试模型在 44 种职业和九大行业中的真实世界任务)上,Sonnet 5.5 的得分几乎与 Opus 5.5 持平,比 Sonnet 5 高约 400 分。它在计算机使用和图表识别方面接近 Opus 5.5,并在长时程知识工作上明显优于 Sonnet 5 和 GPT-6 Sol。
早期测试者强调了较难量化的改进。他们发现它是一个更自然的对话伙伴,并称赞其设计才能,指出它能为用户界面增添精致感,并能遵循幻灯片模板制作出几乎无需编辑的演示文稿。在一项内部测试中,我们给它提供了一家上市公司的季度财报材料和电话会议记录,以及一个幻灯片模板,并要求制作一份 10 页的运营回顾。两位专家判定其初稿可直接发送。
引述
“在不更改任何提示词的情况下,Claude Sonnet 5.5 在我们几乎所有离线 Slackbot 评估中都优于 Sonnet 5,步骤更少,输出 token 减少约 14%。当有人给 Slackbot 分配任务时,质量和速度最为重要,而 Sonnet 5.5 让 Slackbot 能够更快地为用户带来更好的结果。”
公司Slack
作者Curtis Allen,首席工程师
成本与速度
定价
| 每 100 万 token 价格 | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| 缓存读取 | $0.20 | $0.20 |
| 缓存写入 | $2.50 | $5 |
| 输入 token | $2 | $4 |
| 输出 token | $10 | $20 |
Sonnet 5.5 每项任务所需的 token 比 Sonnet 5 更少,因此运行成本更低。它的输出生成速度也提升了 30% 以上,其效率立竿见影:
提示词:
一个 HTML 文件中 400 只椋鸟的群飞
Claude Sonnet 5
Claude Sonnet 5.5
调整努力级别可让你在成本与速度同整体质量之间取得平衡。在 Claude Code 和我们的应用中,默认努力级别设为 Medium,而 Claude Platform 默认为 High。在较低设置下,Claude 回答更快、使用的 token 更少,适合日常工作。在较高设置下,Claude 会进行更长时间的推理,并更彻底地检查其工作。
安全性
对齐
Sonnet 5.5 并未推进我们模型能力的前沿,因此我们的对齐评估聚焦于一组适用于任何能力水平模型的针对性风险,包括违背用户利益行事、误导用户,以及配合高风险滥用行为。
在我们的自动化行为审计中(该审计在约 1,850 个场景中测试 Claude),Sonnet 5.5 在对齐、抵御滥用和诚实性的大多数衡量指标上优于或持平 Sonnet 5。在我们较新的遏制评估中,Sonnet 5.5 在极少尝试逃离沙箱方面接近我们测试过的最佳模型 Opus 5.5,并且在我们所有模型中,它最不可能试探其容器的边界。在整个审计中,Opus 5.5 的整体表现仍略好,但我们未发现任何证据表明 Sonnet 5.5 追求与用户意图相冲突的目标。
正如我们在近期对齐评估中所述,没有任何一组评估能可靠地捕捉到所有失败情况,Sonnet 5.5 可能存在我们尚未发现的倾向,因此我们将自己的对齐工作与下文所述的保障措施相结合。
保障措施
网络安全。Sonnet 5.5 的网络能力较 Sonnet 5 有大幅提升,因此我们部署它时采用了与 Opus 5.5 类似的保障措施。用户仍可在日常软件开发中发现并修复代码中的漏洞,但风险较高的网络安全任务将明显回退到 Sonnet 5。不久后,网络防御者将可以申请我们扩展后的网络验证计划,以获得对 Sonnet 5.5、Opus 5.5 和 Claude Mythos 模型更高级能力的分级访问权限。
生物学。Sonnet 5.5 使用与 Sonnet 5 相同的生物学防护措施。这些措施针对有害请求;大多数研究、教育和临床工作不受影响,但部分微生物学和病毒学请求可能会被误标记。机构可以申请我们的 生命科学验证计划,以获取为全方位生物学相关工作设计的防护措施。
蒸馏。蒸馏攻击是指攻击者利用数千个虚假账户以工业化规模提取模型能力,使恶意行为者能够在没有我们为 Claude 内置的防护措施的情况下创建高能力模型。由于 Sonnet 5.5 的能力远超其前代,它是首个在发布时配备安全分类器以防止推理提取的 Sonnet 模型。Sonnet 5.5 还扩展了保留思考功能,使 Claude 的思考无法与创建它的账户解耦。大多数开发者不会注意到变化。如果你在账户之间移动对话,包括在 Claude Code 中会话中途切换账户,我们的文档文章解释了这一变化。
开始使用
与 Opus 5.5 和 Sonnet 5 一样,Claude Sonnet 5.5 可在零数据保留的情况下使用。
Claude Sonnet 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。开发者可以在 Claude Platform 上使用 claude-sonnet-5-5 开始使用。如果你在关闭思考的情况下运行 Sonnet,则需要切换到新的 between_tools 设置(该设置保持预先思考关闭),然后再迁移到 Sonnet 5.5。详情请参阅我们的迁移指南。
来源:Hacker News:AI 热帖 · anthropic.com