热点事件持续更新
PACT:LLM 强化学习后训练的 Critic 对齐新方法
2 篇报道2 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 9 月 22 日,HuggingFace Daily Papers 收录一篇社区热门论文,提出 PACT(Policy Aligned Critic Training)方法,用于大语言模型强化学习后训练。该方法针对 critic 与策略对齐问题,采用 Actor-then-Critic 的更新顺序,并对 critic 训练施加重要性采样校正,使 critic 与更新后的策略更好对齐。9 月 29 日,小红书技术公众号(dots.llm)发布一手报道,称该方法由小红书 AllSpark 团队提出,通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐,在 SWE-bench Verified 上达到 67.4%。早先报道未披露实验细节与提出方,后续报道补充了团队归属、技术细节与基准成绩。
AI 根据报道生成 · 53 分钟前更新
最新进展9月29日 17:59
小红书 AllSpark 披露 PACT 技术细节,SWE-bench Verified 达 67.4%。事件进展
2 个进展
- 9月29日 17:59 · 1 篇报道小红书AllSpark提出PACT改进长程Agent信用分配公众号:小红书技术(dots.llm):小红书 AllSpark 提出 PACT:从信用分配到 Critic 对齐,SWE-bench Verified 达 67.4%
- 9月22日 08:00 · 1 篇报道PACT:从信用分配到 Critic 对齐,LLM 强化学习后训练新方法HuggingFace Daily Papers(社区热门论文):PACT:从信用分配到 Critic 对齐,LLM 强化学习后训练新方法
报道时间线
沿着报道,了解事件的不同侧面。
9月29日
- 公众号:小红书技术(dots.llm)小红书 AllSpark 提出 PACT:从信用分配到 Critic 对齐,SWE-bench Verified 达 67.4%
小红书 AllSpark 团队提出 PACT(Policy Aligned Critic Training),通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐。
9月22日
- HuggingFace Daily Papers(社区热门论文)PACT:从信用分配到 Critic 对齐,LLM 强化学习后训练新方法
研究者提出 PACT(Policy Aligned Critic Training),通过 Actor-then-Critic 更新顺序对 critic 训练施加重要性采样校正,使 critic 与更新后的策略更好对齐。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。