HuggingFace Daily Papers·· 2 天前AI 评分45
LoGRA:用低秩梯度草图扩展 LLM 强化学习
LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches
AI 导读
LoGRA 通过低秩梯度草图保留学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不牺牲性能。该方法结合 predicted-KL 步长控制,避免过大更新破坏训练,并能在单个八卡节点上稳定训练 27B 参数模型超过 1,100 步,而稠密 Adam 在此场景下会内存耗尽。代码已在库中开源。
来源:HuggingFace Daily Papers · arxiv.org