HuggingFace Daily Papers·· 4 天前AI 评分39
无标签引导:将测试时强化学习压缩到仅偏置子空间
Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces
AI 导读
一种无标签、仅优化偏置参数的测试时强化学习(TTRL)方法,用多数投票伪标签作为奖励,冻结预训练主干,仅训练约 100K 偏置参数。在 MATH-500 上,Qwen2.5-7B 达到 76.67% 准确率,略超其有标签偏置引导复现结果,且参数量比全参数 TTRL 少 76,000 倍。
来源:HuggingFace Daily Papers · arxiv.org