Anthropic 发布 Claude Sonnet 5.5:Terminal-Bench 4.0 得分 70.6%,价格维持 $2/$10
Anthropic Releases Claude Sonnet 5.5: 70.6% on Terminal-Bench 4.0 at the Same $2/$10 Price
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
同一事件,精选展示《Anthropic 发布 Claude Sonnet 5.5,Artificial Analysis 智能指数得分 56,仅次于 Opus 5.5》
Anthropic 刚刚发布了 Claude Sonnet 5.5。这是 Claude 5.5 家族中的第二个模型,紧随 Claude Opus 5.5 之后。Anthropic 将其定位为 Opus 5.5 更快、成本更低的补充。它面向范围明确的日常任务、bug 修复,以及打磨文档、幻灯片和电子表格。
它可以部署吗? 可以,它已在 Claude Platform 上线,代号为 claude-sonnet-5-5,同时登陆 AWS、Google Cloud 和 Microsoft Azure。这是一个闭源权重模型,因此无法自行托管。
相比 Sonnet 5 有哪些变化
Anthropic 报告称,相比 Sonnet 5 有 4 项主要升级:
- 速度: 输出生成速度提升 30% 以上,使其成为迄今为止最快的 Sonnet。
- 每任务成本: 最高降低 30%,因为它需要的 token 和工具调用更少。
- 写作: 行文更清晰,早期测试者称它是更好的协作伙伴。
- 视觉与长时程任务: 这是首个仅凭截图就能通关 Pokémon Red 的 Sonnet。
来自 模型概览 的规格:1M token 上下文、128K 最大输出,以及 2026 年 6 月的可靠知识截止日期。自适应思考默认开启。Effort 分为 5 个级别:low、medium、high、xhigh 和 max。
基准测试
以下所有分数均为厂商在 发布文章 中报告。方法论见 Sonnet 5.5 System Card。
- Terminal-Bench 4.0: 70.6%,而 Sonnet 5 为 10.3%,Opus 5.5 在 Xhigh 下为 66.4%。
- CursorBench 4.0: 55.5%,比 Opus 5.5(57.8%)低约 2 个百分点。
- FrontierCode 1.1: Xhigh 下为 52.1%,Max 下为 46.2%。GPT-6 Sol 得分为 49.3%。
- GDPval-AA v2.1: 1844,而 Opus 5.5 为 1846,Sonnet 5 为 1449。
- OSWorld 2.1: 计算机使用方面为 80.1%,接近 Opus 5.5(81.8%)。
- Humanity’s Last Exam: 使用工具时为 64.5%,高于此前的 54.9%。
Max 结果低于 Xhigh 是有原因的。在 Max 下,模型更常运行多智能体代码审查。这有时会导致超时或超出范围的编辑,而 FrontierCode 会对此扣分。Anthropic 还表示,Opus 5.5 在复杂、开放式工作上仍然明显更强。
定价与效率
标价与 Sonnet 5 保持不变:每百万输入 token 2 美元,每百万输出 token 10 美元。缓存读取每百万 token 0.20 美元,缓存写入每百万 token 2.50 美元。这是 Opus 5.5(4 美元/20 美元)的一半。节省来自 token 效率,而非降价。
客户数据支持这一点。Balyasny Asset Management 测得每个答案约 121K token,而 Sonnet 5 为 497K。Base44 报告每次应用构建迭代 3.6 次,而 Opus 5 为 7.7 次。Zendesk 处理工单速度提升 20%。
Effort 默认值因平台而异。Claude Code 和 Claude 应用默认为 Medium。Claude Platform 默认为 High。
对比情况
| 功能 | Claude Sonnet 5.5 | GPT-6 Sol | Gemini 3.1 Pro Preview | Claude Opus 5.5 |
|---|---|---|---|---|
| 开发者 | Anthropic | OpenAI | Anthropic | |
| 每 1M token 价格(输入/输出) | $2 / $10 | $2 / $10(提示最长 272K) | $2 / $12(提示最长 200K) | $4 / $20 |
| 上下文窗口 | 1M token | 1,050,000 token | 1,048,576 token | 1M token |
| 最大输出 | 128K token | 128K token | 65,536 token | 128K token |
| 知识截止日期 | 2026年6月 | 2026年4月20日 | 未列出 | 2026年6月 |
| 推理控制 | 自适应思考,5个努力等级 | 6个努力等级(从none到max) | 支持思考 | 自适应思考(始终开启) |
| 输入 | 文本、图像 | 文本、图像 | 文本、图像、视频、音频、PDF | 文本、图像 |
| FrontierCode 1.1 | 52.1%(Xhigh) | 49.3% | 未报告 | 54.4% |
| GDPval-AA v2.1 | 1844 | 1487 | 未报告 | 1846 |
| Chartography(无工具) | 61.6% | 53.6% | 未报告 | 64.4% |
| 发布阶段 | 正式可用 | 正式可用 | 预览 | 正式可用 |
| 开放权重 | 否 | 否 | 否 | 否 |
基准测试分数由Anthropic自行报告;GDPval-AA由Artificial Analysis运行。价格为标准API标价,核实于2026年9月28日。
交互式讲解
Claude Sonnet 5.5,交互式讲解
点击浏览基准测试、努力等级、任务成本和API迁移检查器。
选择一个努力等级。Sonnet 5.5提供5个。
推理深度
速度与token节省
仪表为示意性质,反映Anthropic所描述的方向(努力等级越高,推理时间越长,对工作的检查越多)。建议来自Sonnet 5.5迁移指南。
按标价(每100万token输入$2、输出$10,Sonnet 5与5.5相同)的示意性估算。
Sonnet 5,每任务
Sonnet 5.5,每任务
按每月10,000个任务计算,你可节省
节省来自更少的token和工具调用,而非更低的标价。你的实际比例取决于工作负载。
从你的Sonnet 5时代代码中选择一个设置,看看Sonnet 5.5会返回什么。
来源:Anthropic发布帖和Claude Platform文档,2026年9月28日© Marktechpost
要点
- Sonnet 5.5在Terminal-Bench 4.0上得分70.6%,高于此前的10.3%。
- 定价保持$2/$10,但每任务成本最多下降30%。
- 它在GDPval-AA上与Opus 5.5相差不到2分。
- 首个具备网络防护和推理提取分类器的Sonnet。
- 现可通过API、AWS、Google Cloud和Azure部署。
查看官方公告、迁移指南和系统卡。所有功劳归于本项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的Newsletter。等等!你在telegram上吗? 现在你也可以在telegram上加入我们了。
需要与我们合作推广你的GitHub Repo或Hugging Face页面或产品发布或网络研讨会等? 联系我们
文章Anthropic发布Claude Sonnet 5.5:在Terminal-Bench 4.0上达到70.6%,价格同为$2/$10首发于MarkTechPost。
来源:MarkTechPost(RSS) · marktechpost.com