跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分45

模型内部表征何时有用?表征工程在 LLM 安全中的角色评估

When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

AI 导读

一项匹配评估对比了表征工程与行为安全防护在 LLM 安全控制与监控上的表现。安全控制方面,DPO 整体控制最强且随训练数据增加而提升,但后续良性微调会削弱其安全性;表征引导仅在低数据场景(尤其高质量对比数据)保持竞争力。安全监控方面,专用文本监控器检测准确率最高,表征探针则以更低边际成本保持竞争力,监控引导干预还能在几乎不增加过度拒答的情况下恢复 DPO 因良性微调损失的大部分安全性。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org