
资讯
UnifiedPlayers:用「三位玩家」协作框架强化 agent 工具集成推理
一句话:9 月 17 日 arXiv 论文 UnifiedPlayers 提出协作框架:由 Planning Player(出题)、Execution Player(带 Python 工具调用的多轮轨迹)、Evaluation Player(构建可执行验证器)在 GRPO 下协同,解决自进化方法中规划/执行/评估相互变化的协调难题。
背景
- 自进化方法让用工具 agent 自产训练数据以减少人工标注,但现有方法把轨迹生成与评估分离,静态验证器无法适应新失败模式或可能强化跨轨迹共享的错误。
核心要点
- 提出 UnifiedPlayers 协作框架:规划、执行、评估三个角色在共享学习目标下由角色专属奖励协调。
- Execution Player 产出带 Python 工具调用的多轮轨迹;Evaluation Player 构建可执行验证器而非静态规则。
- 在两个模型底座与 12 个推理基准上,较最强基线提升至少数学推理 3.5%、通用推理 3.9%。
- 所学验证器达 84.2% 对抗检测准确率,其奖励信号每题方差是 self-consistency 基线的 2.03 倍,判别性更强。
为什么重要
- 把 agent 的规划、执行、评估统一进可协同优化的框架,是自增强工具集成 agent 的可行路径。
- 可执行验证器替代静态规则,能随失败模式演化,提升训练数据的可靠性。
关键事实速记
- 论文:arXiv 2609.20089(2026-09-17)
- 框架:UnifiedPlayers(3 Players)
- 提升:数学 +3.5% / 通用 +3.9%
- 验证器:84.2% 对抗检测
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考