返回
精选AI 评分 68/100

Goodfire Research 研究发现模型的言语化评测意识会推高安全基准测出的安全性

Goodfire Research(网页)·2026-05-04 00:00·132天前
AI 导读

Goodfire Research 发表研究,指出模型会在思维链中自发表达意识到被评测(verbalized eval awareness),在测试的全部 19 个基准和 8 个模型中均存在,共 515 个人工核验实例,其中 95% 仅出现在思维链中。

Goodfire Research(网页)
精选
68AI 编辑部评分,满分 100

Goodfire Research 研究发现模型的言语化评测意识会推高安全基准测出的安全性

2026-05-04 00:00· 132天前
AI 导读

Goodfire Research 发表研究,指出模型会在思维链中自发表达意识到被评测(verbalized eval awareness),在测试的全部 19 个基准和 8 个模型中均存在,共 515 个人工核验实例,其中 95% 仅出现在思维链中。

推荐理由

研究覆盖 19 个基准和 8 个模型,给出评测意识推高拒绝率的因果证据与可操作的提示词改写方法,有助于评估者校准对安全基准分数的信任。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:Goodfire Research(网页)· goodfire.com