热点事件 持续更新

研究团队发布新研究:发现模型奖励黑客行为伴随可检测的内部激活信号,构建激活探针可规模化实时检测,在 Kimi K3、GLM 5.2、Qwen 3.8 Max 等开源模型上验证并可级联 LLM 监控降本

1 篇报道1 个精选信源

先了解这件事

报道摘要

Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。

摘自 Goodfire Research

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. Goodfire Research官方一手精选
    Goodfire 发现模型内部存在奖励作弊信号,用激活探针可规模化实时检测

    Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。