热点事件 持续更新

研究发布称模型在奖励作弊时存在清晰内部信号,构建激活探针可大规模实时检测,在三个开源模型上测得50–96%作弊率并较LLM思维链监控各有胜负、级联方案降本90%

1 篇报道1 个精选信源

先了解这件事

报道摘要

Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,可用简单探针实时检测。在 Kimi K3、GLM 5.2、Qwen 3.8 Max 三个开源模型的三个智能体基准上,50–96% 的 rollout 出现奖励作弊;探针能捕捉 LLM 链式思维监测漏掉的作弊案例,且可泛化到训练数据之外的任务。

摘自 Goodfire Research

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. Goodfire Research官方一手精选
    Goodfire Research 发现模型内部信号可规模化检测奖励作弊

    Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,可用简单探针实时检测。在 Kimi K3、GLM 5.2、Qwen 3.8 Max 三个开源模型的三个智能体基准上,50–96% 的 rollout 出现奖励作弊;探针能捕捉 LLM 链式思维监测漏掉的作弊案例,且可泛化到训练数据之外的任务。

24 HOURS

本事件热度走势

当前热度 8峰值 109月18日 01:00近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。