Dan Hendrycks· @hendrycks · X·· 2025-11-26精选AI 评分78
AI 导读
AI 安全研究者 Dan Hendrycks 在 X 上发布对 Claude Opus 4.5 与 Google Gemini 3 的横向评测,包含文本、视觉与安全三个维度的指数得分。结果显示:在控制推理令牌数后,两者文本能力相当;Gemini 3 在图像/视觉任务上显著领先;而 Opus 在对抗性测试(如越狱、诚实性)中表现更优。图表显示了 7 模型的文本能力(Gemini 3 Pro 47.6 领先)、视觉能力(Gemini 3 Pro 57.1 最高)及安全指数(Opus 33.6 最低,即最安全)。
推荐理由
该评测由知名 AI 安全研究者主导,数据维度全面(文本、视觉、安全),且直接对比当前头部模型,为读者提供了可量化的横向参考;尤其安全指标反常识(越低越好),有助于理解“能力”与“安全性”的权衡,对选型和风险评估有实用价值。
正文 · AI 翻译
Claude Opus 4.5 与 Gemini 3 相比如何?
- 推理/文本:在控制推理 token 数量的情况下,Gemini 3 ≈ Opus
- 多模态:在视觉/图像输入方面,Gemini 3 > Opus,且优势明显
- 安全:能力 ≠ 安全。在越狱、诚实性等方面,Opus > Gemini
来源:Dan Hendrycks · x.com