热点事件持续更新
Salesforce提出Critical-State RL优化多轮工具调用
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年9月28日,Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练。该方法针对奖励依赖后续轮次、奖励变化很大程度来自下游噪声的问题,采用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。
AI 根据报道生成 · 1 小时前更新
最新进展9月28日 23:42
Salesforce提出Critical-State RL,仅训练关键轮次,BFCL v4任务提升约14分。报道时间线
沿着报道,了解事件的不同侧面。
9月28日
- X:DAIR.AI (@dair_ai)Salesforce 提出 Critical-State RL 优化多轮工具调用
Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练:当奖励依赖后续轮次时,其变化很大程度来自下游噪声,该方法用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。