返回
AI 评分 43/100

当大模型强化学习走向规模化,Batch Size Scaling 有什么不一样?

腾讯混元:Research(API)·2026-09-19 00:43·3天前·RL Team
AI 导读

腾讯混元研究团队从第一性原理分析 LLM 强化学习中的 batch size scaling,提出以 time-to-target 为判据:只有当吞吐增益 r_q 超过样本代价 r_N 时,更大的 batch 才能缩短训练时间。

腾讯混元:Research(API)
43AI 编辑部评分,满分 100

当大模型强化学习走向规模化,Batch Size Scaling 有什么不一样?

2026-09-19 00:43· 3天前· RL Team
AI 导读

腾讯混元研究团队从第一性原理分析 LLM 强化学习中的 batch size scaling,提出以 time-to-target 为判据:只有当吞吐增益 r_q 超过样本代价 r_N 时,更大的 batch 才能缩短训练时间。

该来源未收录可展示正文,站内仅提供摘要。

阅读原文(在新标签页打开)

来源:腾讯混元:Research(API)· hunyuan.tencent.com