跳到正文
原文
Dan Hendrycks· @hendrycks · X·· 2025-11-20精选AI 评分85
AI 导读

AI 研究者 Dan Hendrycks 在 X 上宣布发布「文本能力指数」与「视觉能力指数」两个新基准,用于追踪 AI 模型进展。图表显示 Gemini 3 Pro 在两项指标中均显著领先,文本能力得分 46.5,视觉能力得分约 57;其性能跃升幅度被作者称为‘长期最大飞跃’。榜单共涵盖 7 模型,包括 GPT-5.1、Sonnet 4.5、GroK 4 等。

推荐理由

该基准由知名 AI 安全研究者主导,具有较高公信力;首次系统性量化对比多模型在推理、编码、视觉等核心能力上的表现,尤其凸显 Gemini 3 Pro 的突破性进步,为公众和行业提供了权威参考依据,值得关注。

正文 · AI 翻译

Gemini 3 的跃升究竟有多大?

我们刚刚发布了一个新的排行榜来追踪 AI 的发展。
Gemini 3 是很长时间以来最大的一次飞跃。

来源:Dan Hendrycks · x.com