HuggingFace Daily Papers·· 5 天前AI 评分39
高效推理训练并不总会损害 CoT 忠实性与可监控性
Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability
AI 导读
研究用固定生成预算、按样本长度目标和组相对长度奖励三种方式对大语言模型做长度压缩微调,发现高效推理对 CoT 忠实性与可监控性的影响并不相同。多数设置下忠实性下降,主因是训练后模型一致性变差;可监控性更稳健,即使 CoT 大幅缩短,模型仍会说明输入干预对答案的影响。
来源:HuggingFace Daily Papers · arxiv.org