Cool post training work built on Olmo 3 :)
RL is expensive, so every step should count. ~1 yr ago, we showed xent SFT isn’t the best way to prepare for RL (https://arxiv.org/abs/2510.15020). Now, we prop...
基于 Olmo 3 的酷炫后训练工作 :) RL 成本高昂,所以每一步都应算数。约 1 年前,我们展示了 xent SFT 并非为 RL 做准备的最佳方式(https://arxiv.org/abs/2510.15020)。现在我们提出 TailSFT(https://arxiv.org/abs/2608.25756),一种轻量且有原则的方法,可直接提升覆盖度并获得更好的 RL 后性能。
基于 Olmo 3 的酷炫后训练工作 :) RL 成本高昂,所以每一步都应算数。约 1 年前,我们展示了 xent SFT 并非为 RL 做准备的最佳方式(https://arxiv.org/abs/2510.15020)。现在我们提出 TailSFT(https://arxiv.org/abs/2608.25756),一种轻量且有原则的方法,可直接提升覆盖度并获得更好的 RL 后性能。
Cool post training work built on Olmo 3 :)
来源:Nathan Lambert· x.com