# Goodfire Research 研究发现模型的言语化评测意识会推高安全基准测出的安全性

- 来源：Goodfire Research（网页）
- 发布时间：2026-05-04 00:00
- AIHOT 分数：68
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmtym4ai6000frop0g2iewo9x
- 原文链接：https://www.goodfire.com/research/verbalized-eval-awareness-inflates-measured-safety

## 精选理由

研究覆盖 19 个基准和 8 个模型，给出评测意识推高拒绝率的因果证据与可操作的提示词改写方法，有助于评估者校准对安全基准分数的信任。

## AI 摘要

Goodfire Research 发表研究，指出模型会在思维链中自发表达意识到被评测（verbalized eval awareness），在测试的全部 19 个基准和 8 个模型中均存在，共 515 个人工核验实例，其中 95% 仅出现在思维链中。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
