Anthropic 发布 Claude Sonnet 5.5,Terminal-Bench 4.0 得分 70.6%,远高于 Sonnet 5 的 10.3%,价格维持 $2/$10 每百万输入/输出 token。
原文对比了 Sonnet 5.5 的跑分和每任务成本,指出低成本档位也能超过上代最高分,阅读时可关注定价经济性这条主线。
Claude Sonnet 5.5 已发布,在 Terminal-Bench 4.0 上得分 70.6%,相比 Sonnet 5 的 10.3% 大幅提升,而价格保持不变。
总体而言,由于速度更快、工具调用更少,每任务成本降低 30%。
维持 Sonnet 5 的每百万输入/输出 token 2 美元/10 美元的价格,是 Opus 5.5 费率的一半。
其节省反而来自每项任务完成的工作更少,因为 Anthropic 表示,更少的 token 和工具调用可将一项任务的总成本降低最多 30%。
输出速度也比 Sonnet 5 快 30% 以上,使 Sonnet 5.5 成为 Anthropic 迄今最快的 Sonnet。
用户可以调节 effort 设置,以更长的推理和更多自我检查换取更高的每任务成本。
经济性可能比排行榜更重要。Sonnet 5.5 在 Low 或 Medium effort 下运行时,能够以约十分之一的每任务成本超过 Sonnet 5 的最高分。在 FrontierCode 上,据称 Sonnet 5.5 在 High effort 下的得分比相同设置下的 Sonnet 5 高出约 10 分,而每任务成本约为其十五分之一。
Anthropic 将 Sonnet 5.5 描述为非常适合相对明确的常规工作,例如软件调试、编码、文档制作、构建演示文稿和电子表格,以及设计或优化界面。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.在 X 查看被引用的帖子
来源:Rohan Paul · x.com