Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且总成本低约 40%

The Decoder:AI News(RSS)·2026-09-23 00:31·29分钟前·Matthias Bastian
AI 导读

Anthropic 发布 Claude Opus 5.5,称其在多数任务上达到 Claude Fable 5.1 水平,总运营成本比 Opus 5 低约 40%,输出速度快 30% 以上。

The Decoder:AI News(RSS)
精选
83AI 编辑部评分,满分 100

Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且总成本低约 40%

2026-09-23 00:31· 29分钟前· Matthias Bastian
AI 导读

Anthropic 发布 Claude Opus 5.5,称其在多数任务上达到 Claude Fable 5.1 水平,总运营成本比 Opus 5 低约 40%,输出速度快 30% 以上。

推荐理由

原文给出官方定价、token 降幅和多项基准对比数字,读者可据此评估该模型在成本与性能上的实际位置。

正文 · AI 翻译
Image description

Anthropic 正在推出 Claude Opus 5.5,这是全新模型家族中的首个模型。该公司表示,它能提供 Claude Fable 5.1 级别的性能,同时成本显著更低,运行速度也比其前代更快。

据 Anthropic 称,Opus 5.5 在"大多数任务上"与 Claude Fable 5.1 相当,而运行成本比 Opus 5 低约 40%。Claude Sonnet 5.5 和 Haiku 5.5 预计将在未来几周内推出,在性能、效率和安全方面具有类似的提升。Anthropic 的基准测试显示,新的 Opus 模型在大多数任务上领先于 Fable 5.1 和 OpenAI 价格高得多的 GPT-6 Astra

基准测试 / 能力 Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol
智能体编程
Terminal-Bench 4.0[1]
66.4% 55.8% 52.3% 57.9% 37.3%
智能体编程
FrontierCode v1.1(主)
54.4% 50.3% 48.0% 53.3% 47.5%
智能体编程
CursorBench 4.0
57.8% 51.8% 46.6% N/A 41.7%
知识工作
GDPval-AA v2.1
1,846 1,735 1,708 1,542 1,588
业务流程
AutomationBench[1]
40.0% 31.4% 26.9% 41.4% 28.8%
多学科推理
Humanity's Last Exam
67.7%
(使用工具)
65.6%
(使用工具)
63.6%
(使用工具)
57.2%
(使用工具)
不适用
智能体科学研究
Terminal-Bench-Science 0.1[1]
58.7% 52.6% 29.0% 64.6% 22.4%
计算机使用
OSWorld 2.0
81.8%
(部分)
80.7%
(部分)
74.0%
(部分)
不适用 不适用
可视化图表识别
Chartography
89.0%
(使用工具)
88.4%
(使用工具)
83.4%
(使用工具)
不适用 不适用

Anthropic 表示,新系列主要回应了客户在成本、效率和沟通质量方面的反馈,尤其是在金融服务、法律和软件开发领域。

更低的价格和 token 用量降低了运营成本

Anthropic 将 Opus 5.5 定价为每百万输入 token 4 美元、每百万输出 token 20 美元,低于 Opus 5 的 5 美元和 25 美元。这意味着 token 价格下降了 20%。该公司还将缓存读取成本降低了 60%。

Anthropic 表示,总运营成本(同时计入 token 价格和 token 用量)应比 Opus 5 低约 40%。该模型使用的 token 更少,输出生成速度提升超过 30%。

每 1M token 价格 Claude Opus 5.5 Claude Opus 5
缓存读取 $0.20 $0.50
输入 token $4 $5
输出 token $20 $25
缓存写入 $5 $6.25

订阅用户的五小时使用限额将提高 20%。Anthropic 表示,得益于该模型更低的成本,这些限额总体上还能再延长 25%。用户还可以保留一次限额重置,留到最需要的时候使用。

Anthropic 正借助编程基准测试来论证其在价格和性能上的优势。在 FrontierCode 上,该公司称 Opus 5.5 击败了 OpenAI 的 GPT-6 Astra,而每任务成本仅约为后者的 20%。在 Terminal-Bench 4.0 上,它声称以 40% 的成本实现了与 Astra 相同的性能。在 CursorBench 上,它表示 Opus 5.5 以三分之一的成本领先 GPT-5.6 Sol 11 分。

此次降价是对来自 OpenAI、尤其是中国 AI 模型压力的回应,这些模型性能较低,但成本仅为前者的一小部分

Anthropic 承诺减少“Claude 腔”

Opus 5.5 还应当比早先的模型表达得更自然。Anthropic 表示,它会把最重要的信息放在最前面,少用行话,并且更严格地遵循写作指令。早期测试者称其文字更清晰、更易懂,Anthropic 表示这使它成为长时间工作会话中更好的伙伴。当前的 Claude 模型因其公式化、晦涩难懂的文风,有时被称为“Claude 腔”,而饱受批评。

截图来自 PAW

Opus 5.5 也是首个在网络安全、生物学和前沿 LLM 开发方面拥有与 Fable 5.1 同等防护措施的 Opus 模型。Anthropic 表示,当这些防护措施触发时,请求会被透明地路由到另一个模型。

用户仍然可以在自己的代码中发现并修复 bug,但大多数网络安全任务将交由较旧的 Opus 4.8 处理。被分类器标记为涉及生物学或前沿 LLM 开发的请求将交由 Opus 5 处理。

经过验证的组织可以通过生命科学验证计划申请将该模型用于生物学研究。Anthropic 计划在未来几周内将其现有的网络验证计划扩展到 Opus 5.5。

Claude Opus 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。使用 Claude Platform 的开发者可以通过模型 ID claude-opus-5-5 访问它。

Anthropic 呼吁在模型能力日益增强之际提高安全标准

Anthropic 计划更严格地审查强化学习环境。该公司表示,有缺陷的训练环境是模型行为失准的主要来源。它还在致力于更好的对齐奖励、自动创建安全训练场景的方法,以及更强的安全和监控措施。

AI 实验室正在争论应以多快的速度发布能力更强的模型。OpenAI 最近呼吁为能够自我改进的 AI 系统制定国际标准,而多位研究人员已公开敦促各实验室在对齐方法跟上之前放缓发布。Anthropic 采取了类似立场,呼吁对可能完全自动化 AI 研究的模型制定更高的安全标准。该公司表示,公共政策应在制定该标准方面发挥更大作用。外部机构Frontier DesignMETR在 Opus 5.5 发布前对其进行了测试。

新限制针对知识蒸馏,并支持欧盟 AI 法案合规

Anthropic 还针对其所谓的蒸馏攻击推出了应对措施。该公司表示,攻击者利用数千个虚假账号以工业化规模提取模型能力,并在没有其安全保障的情况下构建出能力极强的模型。Anthropic 援引了一份 2026 年 9 月的威胁报告,其中记录了其迄今已检测并阻止的非法蒸馏活动。

Opus 5.5 发布时搭载了“Preserved Thinking”,这是一项最早随 Fable 5.1 推出的反蒸馏措施。它阻止 API 用户编辑 Claude 此前的上下文以提取其推理过程。该措施适用于 2026 年 8 月 31 日或之后创建的 API 账号下的 Fable 5.1 和 Opus 5.5。

Opus 5.5 还包含水印措施,以符合欧盟《人工智能法案》。该模型不再能在禁用“Thinking”模式的情况下运行,并且支持零数据保留

来源:The Decoder:AI News(RSS)· the-decoder.com