← 资讯列表
资讯

UnifiedPlayers:用「三位玩家」协作框架强化 agent 工具集成推理

📅 2026/9/17 08:00:00👁 1 阅读⏱ 约 3 分钟

一句话:9 月 17 日 arXiv 论文 UnifiedPlayers 提出协作框架:由 Planning Player(出题)、Execution Player(带 Python 工具调用的多轮轨迹)、Evaluation Player(构建可执行验证器)在 GRPO 下协同,解决自进化方法中规划/执行/评估相互变化的协调难题。

背景

  • 自进化方法让用工具 agent 自产训练数据以减少人工标注,但现有方法把轨迹生成与评估分离,静态验证器无法适应新失败模式或可能强化跨轨迹共享的错误。

核心要点

  • 提出 UnifiedPlayers 协作框架:规划、执行、评估三个角色在共享学习目标下由角色专属奖励协调。
  • Execution Player 产出带 Python 工具调用的多轮轨迹;Evaluation Player 构建可执行验证器而非静态规则。
  • 在两个模型底座与 12 个推理基准上,较最强基线提升至少数学推理 3.5%、通用推理 3.9%。
  • 所学验证器达 84.2% 对抗检测准确率,其奖励信号每题方差是 self-consistency 基线的 2.03 倍,判别性更强。

为什么重要

  • 把 agent 的规划、执行、评估统一进可协同优化的框架,是自增强工具集成 agent 的可行路径。
  • 可执行验证器替代静态规则,能随失败模式演化,提升训练数据的可靠性。

关键事实速记

  • 论文:arXiv 2609.20089(2026-09-17)
  • 框架:UnifiedPlayers(3 Players)
  • 提升:数学 +3.5% / 通用 +3.9%
  • 验证器:84.2% 对抗检测

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考