跳到正文
HuggingFace Daily Papers·· 4 天前AI 评分56

研究提出微小 LoRA 可修复 Transformer 过早停止推理的问题

Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

AI 导读

研究发现预训练 Transformer 几乎不利用模型深度来跟随上下文中的引用链,13 个基座模型只能可靠跟随 1.4-3.6 行。在早期一层加入任务训练的 rank-8 LoRA 并冻结其余权重后,Qwen3-8B 在 24 行链上的精确准确率从 15.5% 提升到 99%,Ouro-1.4B 在八次循环后可跟随至少 160 行。

来源:HuggingFace Daily Papers · arxiv.org