热点事件 持续更新
研究团队发布新研究:发现模型奖励黑客行为伴随可检测的内部激活信号,构建激活探针可规模化实时检测,在 Kimi K3、GLM 5.2、Qwen 3.8 Max 等开源模型上验证并可级联 LLM 监控降本
先了解这件事
报道摘要Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。
报道时间线
沿着报道,了解事件的不同侧面。
显示 1 篇全部报道,最新在前
- Goodfire 发现模型内部存在奖励作弊信号,用激活探针可规模化实时检测
Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。