# Stanford 研究发现 AI 基准测试常常测不出它声称测量的东西

- 来源：Stanford HAI News（网页）
- 发布时间：2026-09-25 00:00
- AIHOT 分数：58
- AIHOT 链接：https://aihot.news/items/cmuhibqgf0a85rojn4svbgg9x
- 原文链接：https://hai.stanford.edu/news/the-tests-that-grade-ai-may-be-getting-it-wrong

## AI 摘要

Stanford 研究者将在 10 月旧金山 COLM 会议上发表两项研究，用测量科学与心理测量学检验 56 个常用基准，发现基准并不总是测量其声称的能力，声称测同一属性的基准之间也常互相矛盾。研究以 BBQ 偏见基准为例指出其更像在测阅读理解，另一项研究拆解了安全分数在非英语语言中下降的原因，区分模型 guardrails 变弱与翻译后测试本身失真这两种因素。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
