该来源未收录可展示正文,站内仅提供摘要。
阅读原文(在新标签页打开)当大模型强化学习走向规模化,Batch Size Scaling 有什么不一样?
AI 导读
腾讯混元研究团队从第一性原理分析 LLM 强化学习中的 batch size scaling,提出以 time-to-target 为判据:只有当吞吐增益 r_q 超过样本代价 r_N 时,更大的 batch 才能缩短训练时间。
腾讯混元:Research(API)
43
AI 编辑部评分,满分 100当大模型强化学习走向规模化,Batch Size Scaling 有什么不一样?
腾讯混元研究团队从第一性原理分析 LLM 强化学习中的 batch size scaling,提出以 time-to-target 为判据:只有当吞吐增益 r_q 超过样本代价 r_N 时,更大的 batch 才能缩短训练时间。
来源:腾讯混元:Research(API)· hunyuan.tencent.com