# Goodfire 发布 RLFR 方法：用内部特征探针作奖励将 Gemma-3-12B-IT 幻觉率降低 58%

- 来源：Goodfire Research（网页）
- 发布时间：2026-02-11 00:00
- AIHOT 分数：63
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmtym4ai6000lrop0vqzy3vc3
- 原文链接：https://www.goodfire.com/research/rlfr

## 精选理由

原文给出了用模型内部探针作为 RL 奖励降低幻觉的具体方法、成本对比和消融数据，读者可以据此评估可解释性驱动训练的可行性。

## AI 摘要

Goodfire Research 发布论文，提出 RLFR（Reinforcement Learning from Feature Rewards），用模型内部激活上的轻量探针作为 RL 奖励信号来减少幻觉。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
