
标题ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction来源arXiv, 2608.13622v1️文章简介研究问题在开放式真实世界交互中当存在多种有效行为策略时如何消除跨策略比较带来的奖励模型偏好偏差从而实现公平的相对优势估计主要贡献论文提出ARC训练方法通过策略条件化的 rollout 分组恢复公平比较并构建INTER3框架及INTER3-86K数据集以支持该研究。重点思路定义奖励公平性问题指出在开放交互中不同策略如直接回答、澄清、进度更新均可能有效但传统组基强化学习将不同策略的轨迹混合比较导致奖励模型的风格偏好扭曲相对优势使优化偏向特定风格而非上下文适宜的行为。提出ARC方法采用策略条件化 rollout 分组在训练时为每个样本分配策略指令仅在同策略组内计算相对优势结合混合奖励和熵正则化目标进行策略更新推理时移除指令以实现自主策略选择。构建INTER3框架设计通道分离的异步流式交互架构将用户可见通信与潜在推理及工具执行解耦支持实时中断和 steerability显著降低首字延迟使多样化交互策略可观测且可标注。建立INTER3-86K数据集基于真实在线轨迹、 curated 公共数据及合成数据构建包含8.6万条策略标注样本的训练语料涵盖工具使用、多跳问答等场景为公平跨策略比较提供数据基础。分析总结ARC显著提升工具使用能力在tau/tau2基准测试中ARC大幅优于基线方法特别是在GRPO后端上平均提升5.37分证明其能有效增强多轮工具调用的域内性能。降低延迟并保持能力INTER3架构将首字延迟从4.91秒降至1.27秒同时ARC在该低延迟 regime 下进一步提升了代理能力实现了响应速度与任务成功率的平衡。策略指令仅在训练期有效实验表明推理时移除策略指令能获得最佳整体行为说明ARC并非依赖提示词引导而是通过学习更通用的交互策略内部化了公平比较机制。熵正则化防止生成崩溃在多通道生成中熵正则化对于维持输出多样性至关重要能防止策略收敛至无意义的格式重复与策略分组结合后效果最佳。个人观点论文揭示了开放交互中“比较公平性”这一被忽视的核心瓶颈不同于以往关注奖励信号本身的研究ARC从数据构造和比较机制入手通过策略条件化隔离了风格偏差对优势估计的干扰。