Nathan Lambert · @natolambert · X·2026-09-12 20:38·39分钟前
AI 导读

基于 Olmo 3 的酷炫后训练工作 :) RL 成本高昂,所以每一步都应算数。约 1 年前,我们展示了 xent SFT 并非为 RL 做准备的最佳方式(https://arxiv.org/abs/2510.15020)。现在我们提出 TailSFT(https://arxiv.org/abs/2608.25756),一种轻量且有原则的方法,可直接提升覆盖度并获得更好的 RL 后性能。

Nathan Lambert@natolambert
35AI 编辑部评分,满分 100
2026-09-12 20:38· 39分钟前
AI 导读

基于 Olmo 3 的酷炫后训练工作 :) RL 成本高昂,所以每一步都应算数。约 1 年前,我们展示了 xent SFT 并非为 RL 做准备的最佳方式(https://arxiv.org/abs/2510.15020)。现在我们提出 TailSFT(https://arxiv.org/abs/2608.25756),一种轻量且有原则的方法,可直接提升覆盖度并获得更好的 RL 后性能。

Cool post training work built on Olmo 3 :)

Sadhika MalladiRL is expensive, so every step should count. ~1 yr ago, we showed xent SFT isn’t the best way to prepare for RL (https://arxiv.org/abs/2510.15020). Now, we prop...

来源:Nathan Lambert· x.com