跳到正文
热点事件观察中

Baseten Base Labs发布RL轨迹线性结构研究

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月2日,Baseten Base Labs发布了一项关于强化学习训练轨迹线性结构的研究。该研究复现了此前关于RL优化轨迹近似“直线”的结论,并给出一个具体实验:将Qwen2.5-1.5B在MATH数据集上的首个梯度步放大1000倍,所得模型效果超过经过500步RL训练的模型,准确率分别为66.7%与63.8%。Base Labs在发布说明中表示,他们复现了这一说法,并发现“在某些关键方面,它确实如此”。研究将该现象称为单步梯度更新的“不合理效率”,指出RL训练轨迹的线性结构可被利用。目前该研究以简短发布更新的形式公开,未披露更多实验细节或适用范围。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. Baseten Base Labs:模型研究
    Base Labs 研究:单步梯度更新的"不合理效率"——RL 训练轨迹的线性结构可被利用

    Base Labs 复现了 RL 优化轨迹近似"直线"的结论,发现将 Qwen2.5-1.5B 在 MATH 上的首个梯度步放大 1000 倍,效果超过 500 步 RL 训练的模型(66.7% vs 63.8%)。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。