跳到正文
热点事件观察中

LSPD:最小二乘策略蒸馏提升LLM推理效率

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年9月28日,HuggingFace Daily Papers收录一篇社区热门论文,研究者从强化学习视角重新审视 on-policy distillation(OPD),提出 Least-Square Policy Distillation(LSPD)框架。该工作将价值型强化学习中的乐观探索与 off-policy 数据复用引入策略蒸馏,目标是实现面向样本高效的大语言模型推理。目前报道仅介绍该框架的提出思路与定位,未披露具体实验数据或效果对比。

AI 根据报道生成 · 57 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月28日
  1. HuggingFace Daily Papers(社区热门论文)
    从强化学习视角看 OPD:面向样本高效 LLM 推理的最小二乘策略蒸馏

    研究者从强化学习视角重新审视 on-policy distillation(OPD),提出 Least-Square Policy Distillation(LSPD)框架,将价值型 RL 中的乐观探索与 off-policy 数据复用引入策略蒸馏。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。