HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分40
Box^2-Bench:语言模型能否选择性依赖外部指导?
Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?
AI 导读
研究者提出 Box^2-Bench,在固定模型与任务的前提下改变工作流可靠性,以衡量语言模型能否在受益于可靠指导的同时覆盖不可靠指导,即"跳出框框"的能力。测试显示前沿模型虽能从可靠指导中获益,但在指导具有误导性或变得不可靠时仍很脆弱。团队用坏工作流训练两个开放权重模型,发现反事实监督微调可提升鲁棒性,而基于结果的强化学习能提高对有用工作流的使用,该行为还可迁移到同行纠错和受损记忆的鲁棒性上。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org