跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分45

LoGRA:用低秩梯度草图扩展 LLM 强化学习

LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches

AI 导读

LoGRA 通过低秩梯度草图保留学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不牺牲性能。该方法结合 predicted-KL 步长控制,避免过大更新破坏训练,并能在单个八卡节点上稳定训练 27B 参数模型超过 1,100 步,而稠密 Adam 在此场景下会内存耗尽。代码已在库中开源。

来源:HuggingFace Daily Papers · arxiv.org