返回首页
RadarAI··论文与技术

Salesforce 提出 Critical-State RL 优化多轮工具调用

中文摘要

Salesforce 提出 Critical-State RL,通过嵌套采样分离噪声并仅优化关键调用,使 BFCL v4 任务准确率提升约 14%。

English Summary

Salesforce's Critical-State RL uses nested sampling to isolate noise and optimize key tool calls, improving BFCL v4 accuracy by approximately 14%.

原文节选

Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练:当奖励依赖后续轮次时,其变化很大程度来自下游噪声,该方法用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。