# Olmo 3 上的后训练新工作

- 来源：Nathan Lambert (@natolambert)
- 发布时间：2026-09-12 20:38
- AIHOT 分数：35
- AIHOT 链接：https://aihot.news/items/cmtye3nka0b5mrojh7xh5xuob
- 原文链接：https://x.com/natolambert/status/2098753179273805973

## AI 摘要

基于 Olmo 3 的酷炫后训练工作 :)

RL 成本高昂，所以每一步都应算数。约 1 年前，我们展示了 xent SFT 并非为 RL 做准备的最佳方式（https://arxiv.org/abs/2510.15020）。现在我们提出 TailSFT（https://arxiv.org/abs/2608.25756），一种轻量且有原则的方法，可直接提升覆盖度并获得更好的 RL 后性能。

## 正文

Cool post training work built on Olmo 3 :)

### 引用推文

> Sadhika Malladi：RL is expensive, so every step should count. ~1 yr ago, we showed xent SFT isn’t the best way to prepare for RL (https://arxiv.org/abs/2510.15020). Now, we prop...
