# KPop：用对称二元KL散度解决大模型强化学习的训练推理不一致问题

- 来源：公众号：蚂蚁百灵（Ling）
- 作者：百灵大模型
- 发布时间：2026-06-02 09:00
- AIHOT 分数：68
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmsdu2qga010irofz1h15420q
- 原文链接：https://mp.weixin.qq.com/s?__biz=MzkyODk2MDQwNw%3D%3D&mid=2247486720&idx=1&sn=5169a38e5bfa4e6822d1d2eff256e9ee

## 精选理由

解释固定屏蔽比为何误杀稀有token，并给出用对称二元KL散度自适应调整的方法，有助于理解RL训练不稳定并指导稳定训练实践。

## AI 摘要

蚂蚁百灵团队提出KPop方法，应对大模型强化学习中训练与推理引擎概率分布不一致导致的训练崩溃。KPop用对称二元KL散度替代IcePop的固定比值阈值，仅需一个超参数，对稀有token自适应宽容、对高频token严格约束。在Ring-flash-2.0（总参100B）上支撑800+步稳定RL训练，SWE-bench Verified从70.8%提升至76.28%。

## 正文

公众号正文需在微信内阅读，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
