ToolOrchestra 与 GDP0 多奖励强化学习技术分享纪要

会议纪要 行业研究 / 行业交流纪要 申万: 计算机
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

摘要: 本次分享由英伟达研究员主讲,重点介绍了通过端到端强化学习优化大模型工具编排能力的 ToolOrchestra 工作,以及旨在解决多奖励优化问题的 GDP0 算法。

行业主线:

  1. 工具编排(ToolOrchestra):通过训练小规模调度器(Orchestrator)调用多样化工具和专业模型,旨在提升复杂推理任务的性能与效率,解决模型在调用工具时存在的“自我增强偏置”或“盲目依赖强模型”问题。
  2. 多奖励强化学习(GDP0):针对 GRPO 算法在处理多维度奖励(如准确率、效率、用户偏好)时容易出现信号坍缩、分辨率降低的问题,提出 GDP0 算法,通过对每个奖励维度分别进行解耦归一化,保留奖励间的相对差异,提升训练稳定性。

关键变化与分歧:

  1. 性价比优势:实验表明,采用 8B 小模型作为调度器并调用外部工具的系统,在同等预算下性能优于 GPT-5 等单体模型,且推理速度提升约 2.5 倍,成本降低约 3 倍。
  2. 用户偏好遵循:ToolOrchestra 在处理包含成本或效果偏好的复杂指令时,表现出比 GPT-5 更强的偏好遵循能力。

受益方向与风险:

  1. 受益方向:高效能的小规模 Agent 调度系统、多奖励优化算法在数学/代码推理等复杂任务中的应用。
  2. 风险/局限:强化学习对高质量可验证数据的依赖,以及在极少算力资源下的训练挑战。