跳到正文
热点事件持续更新

PACT:LLM 强化学习后训练的 Critic 对齐新方法

2 篇报道2 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 9 月 22 日,HuggingFace Daily Papers 收录一篇社区热门论文,提出 PACT(Policy Aligned Critic Training)方法,用于大语言模型强化学习后训练。该方法针对 critic 与策略对齐问题,采用 Actor-then-Critic 的更新顺序,并对 critic 训练施加重要性采样校正,使 critic 与更新后的策略更好对齐。9 月 29 日,小红书技术公众号(dots.llm)发布一手报道,称该方法由小红书 AllSpark 团队提出,通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐,在 SWE-bench Verified 上达到 67.4%。早先报道未披露实验细节与提出方,后续报道补充了团队归属、技术细节与基准成绩。

AI 根据报道生成 · 53 分钟前更新

事件进展

2 个进展
  1. 9月29日 17:59 · 1 篇报道
    小红书AllSpark提出PACT改进长程Agent信用分配
    公众号:小红书技术(dots.llm):小红书 AllSpark 提出 PACT:从信用分配到 Critic 对齐,SWE-bench Verified 达 67.4%
  2. 9月22日 08:00 · 1 篇报道
    PACT:从信用分配到 Critic 对齐,LLM 强化学习后训练新方法
    HuggingFace Daily Papers(社区热门论文):PACT:从信用分配到 Critic 对齐,LLM 强化学习后训练新方法

报道时间线

沿着报道,了解事件的不同侧面。

9月29日
  1. 公众号:小红书技术(dots.llm)
    小红书 AllSpark 提出 PACT:从信用分配到 Critic 对齐,SWE-bench Verified 达 67.4%

    小红书 AllSpark 团队提出 PACT(Policy Aligned Critic Training),通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐。

9月22日
  1. HuggingFace Daily Papers(社区热门论文)
    PACT:从信用分配到 Critic 对齐,LLM 强化学习后训练新方法

    研究者提出 PACT(Policy Aligned Critic Training),通过 Actor-then-Critic 更新顺序对 critic 训练施加重要性采样校正,使 critic 与更新后的策略更好对齐。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。