跳到正文
HuggingFace Daily Papers·· 5 天前AI 评分38

SAKIKO:审计工具调用 LLM 内部干预,行为改变不等于修复

When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs

AI 导读

SAKIKO 框架用于审计工具调用 LLM 的内部激活干预,在 7 个 LLM 的 When2Call 和 MetaTool 上,通道定向干预让 5 个模型获得方向性净增益,59 个预算匹配的随机方向均无法复现校准目标增益。

来源:HuggingFace Daily Papers · arxiv.org