跳到正文
热点事件持续更新

Salesforce提出Critical-State RL优化多轮工具调用

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年9月28日,Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练。该方法针对奖励依赖后续轮次、奖励变化很大程度来自下游噪声的问题,采用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月28日
  1. X:DAIR.AI (@dair_ai)
    Salesforce 提出 Critical-State RL 优化多轮工具调用

    Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练:当奖励依赖后续轮次时,其变化很大程度来自下游噪声,该方法用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。