Baseten Base Labs发布RL轨迹线性结构研究
热点事件观察中
Baseten Base Labs发布RL轨迹线性结构研究
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年10月2日,Baseten Base Labs发布了一项关于强化学习训练轨迹线性结构的研究。该研究复现了此前关于RL优化轨迹近似“直线”的结论,并给出一个具体实验:将Qwen2.5-1.5B在MATH数据集上的首个梯度步放大1000倍,所得模型效果超过经过500步RL训练的模型,准确率分别为66.7%与63.8%。Base Labs在发布说明中表示,他们复现了这一说法,并发现“在某些关键方面,它确实如此”。研究将该现象称为单步梯度更新的“不合理效率”,指出RL训练轨迹的线性结构可被利用。目前该研究以简短发布更新的形式公开,未披露更多实验细节或适用范围。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 08:00
Base Labs 研究:单步梯度更新的"不合理效率"——RL 训练轨迹的线性结构可被利用报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- Baseten Base Labs:模型研究Base Labs 研究:单步梯度更新的"不合理效率"——RL 训练轨迹的线性结构可被利用
Base Labs 复现了 RL 优化轨迹近似"直线"的结论,发现将 Qwen2.5-1.5B 在 MATH 上的首个梯度步放大 1000 倍,效果超过 500 步 RL 训练的模型(66.7% vs 63.8%)。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。