[论文解读] Learning Latent Representations to Influence Multi-Agent Interaction
本文提出 LILI,一种强化学习框架,通过学习潜在策略来建模并影响多智能体交互中的非平稳智能体。通过将其他智能体的策略表示为动态潜在变量并利用潜在动力学,自车智能体能够预测并引导对手朝协同适应行为发展,在仿真和真实世界冰球游戏中均表现优异,成功阻挡91%的射门,并促使对手偏好高回报策略。
Seamlessly interacting with humans or robots is hard because these agents are non-stationary. They update their policy in response to the ego agent's behavior, and the ego agent must anticipate these changes to co-adapt. Inspired by humans, we recognize that robots do not need to explicitly model every low-level action another agent will make; instead, we can capture the latent strategy of other agents through high-level representations. We propose a reinforcement learning-based framework for learning latent representations of an agent's policy, where the ego agent identifies the relationship between its behavior and the other agent's future strategy. The ego agent then leverages these latent dynamics to influence the other agent, purposely guiding them towards policies suitable for co-adaptation. Across several simulated domains and a real-world air hockey game, our approach outperforms the alternatives and learns to influence the other agent.
研究动机与目标
- 解决其他智能体因自车智能体行为而动态调整策略的非平稳多智能体交互挑战。
- 使自车智能体能够预测并影响其他智能体的潜在策略,而无需显式建模每一项低层次动作。
- 开发一种无需集中式训练或通信的通用框架,适用于人机协作和去中心化场景。
- 通过学习自车智能体行为如何随时间影响其他智能体潜在策略的演化,提升协同适应能力。
- 在复杂、噪声大且非马尔可夫性的交互场景中展现鲁棒性。
提出的方法
- 自车智能体采用基于变分推断的方法,从其他智能体的观测动作中推断出低维潜在策略表征(z)。
- 潜在动力学模型学习其他智能体策略如何响应自车智能体动作而演化,从而实现对未来策略的预测。
- 自车智能体的策略通过强化学习进行训练,不仅响应当前潜在策略,还能主动影响未来策略以实现协同适应结果。
- 该框架结合逆强化学习与潜在变量建模,以识别并预测其他智能体的隐藏策略。
- 方法采用端到端的离策略深度强化学习(SAC)进行训练,并引入奖励塑形组件,以鼓励对对手策略的影响。
- 该方法在仿真环境和真实世界冰球实验设置中(含机器人与人类对手)均进行了评估。
实验结果
研究问题
- RQ1强化学习智能体能否在多智能体交互中学习并预测非平稳、部分可观测智能体的潜在策略?
- RQ2自车智能体如何利用学习到的潜在动力学,主动影响其他智能体的未来策略以实现更好的协同适应?
- RQ3学习影响潜在策略是否能提升真实世界多智能体任务(如冰球)中的性能?
- RQ4该方法在对手行为存在噪声和非马尔可夫依赖关系时的鲁棒性如何?
- RQ5该框架能否从机器人对手泛化到真实世界中的人类对手?
主要发现
- 在真实世界冰球实验中,LILI 在最后 100 次交互中成功阻挡了 91% 的射门,显著优于 SAC(44%)和随机基线(18%)。
- LILI 有效促使机器人对手将射门导向棋盘左侧 41% 的时间,与自车智能体对左侧阻挡的奖励机制一致。
- 在与人类专家对战时,LILI(无影响)成功阻挡了 73% 的射门(40 次中 29 次),而 SAC 仅阻挡了 45%(40 次中 18 次),展现出更优的协同适应能力。
- LILI 学习到引导对手采用交替策略(如左路与中路),利用对手避免先前被阻挡区域的倾向。
- 消融实验表明,该方法对噪声潜在动力学和非马尔可夫策略演化具有鲁棒性,尤其在长时序依赖场景下表现稳定。
- 在最终阶段,LILI 的平均累积奖励为 1.15 ± 0.05/次交互,高于无影响设置下的 1.00 ± 0.05,证实了主动影响的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。