Skip to main content
QUICK REVIEW

[论文解读] Deep Latent Competition: Learning to Race Using Visual Control Policies in Latent Space

Wilko Schwarting, Tim Seyde|arXiv (Cornell University)|Feb 19, 2021
Reinforcement Learning in Robotics被引用 10
一句话总结

Deep Latent Competition (DLC) 是一种基于模型的多智能体强化学习算法,通过在学习到的潜在空间中进行想象的自对弈,学习竞争性的视觉控制策略。通过结合联合转移函数与对手视角预测,DLC 实现了从原始图像观测出发的可扩展、一致的多智能体规划,其赛车性能优于那些在想象中不考虑对手的基线方法。

ABSTRACT

Learning competitive behaviors in multi-agent settings such as racing requires long-term reasoning about potential adversarial interactions. This paper presents Deep Latent Competition (DLC), a novel reinforcement learning algorithm that learns competitive visual control policies through self-play in imagination. The DLC agent imagines multi-agent interaction sequences in the compact latent space of a learned world model that combines a joint transition function with opponent viewpoint prediction. Imagined self-play reduces costly sample generation in the real world, while the latent representation enables planning to scale gracefully with observation dimensionality. We demonstrate the effectiveness of our algorithm in learning competitive behaviors on a novel multi-agent racing benchmark that requires planning from image observations. Code and videos available at https://sites.google.com/view/deep-latent-competition.

研究动机与目标

  • 解决在部分可观测且输入为高维图像的多智能体环境中学习竞争性高速驾驶行为的挑战。
  • 通过用学习到的世界模型中的想象自对弈替代昂贵的真实环境 rollout,实现视觉控制策略的高效训练。
  • 通过联合建模智能体状态并从自身观测预测对手视角,改进对对手行为的推理能力。
  • 开发一种可扩展、一致的潜在世界模型,以支持在部分可观测条件下的长时程规划。
  • 在新型连续控制赛车基准环境中,展示结合联合动力学与信念估计的想象自对弈的有效性。

提出的方法

  • 使用变分自编码器学习多智能体世界模型,将图像观测编码为紧凑的潜在空间表示。
  • 采用联合转移函数,同时传播两个智能体的潜在状态,确保想象轨迹的一致性。
  • 引入独立的解码器头,从自身智能体视角预测对手的视觉观测,实现信念估计。
  • 利用学习到的世界模型生成长时程的想象 rollout 用于自对弈训练,策略梯度通过想象轨迹反向传播。
  • 通过想象游戏结果的解析梯度更新优化策略,训练过程中避免与真实环境交互。
  • 通过重构损失、预测损失与策略梯度损失的组合,端到端训练智能体。

实验结果

研究问题

  • RQ1在学习到的潜在空间中进行想象的自对弈,是否能在无需真实环境 rollout 的情况下有效训练竞争性视觉控制策略?
  • RQ2当仅一个智能体观测到对手时,联合世界模型在多智能体预测中能否保持一致性?
  • RQ3从自身智能体视角预测对手视角,是否能提升竞争性赛车中的策略性能?
  • RQ4潜在空间世界模型能否在保持规划保真度的同时,扩展到高维图像观测?
  • RQ5与分别传播智能体状态相比,结合联合动力学的想象自对弈在策略性能上表现如何?

主要发现

  • 与那些在想象中不考虑对手的基线方法相比,DLC 智能体实现了更优的赛车性能,证明了联合规划的价值。
  • 想象轨迹在 25 个时间步内对两个智能体的视角均保持一致,准确保留了赛道特征与相对位置。
  • 模型能准确重构可见的对手,并在对手不可见时合理预测其行为,避免输出仅含噪声的结果。
  • 联合转移函数确保了预测在不同智能体间保持一致,从而实现对动作影响的可靠估计。
  • 智能体在想象序列中学会通过迫使对手出界来实现超车,表明其具备战略推理能力。
  • 该方法可实现从原始图像观测的有效训练,而无需使用状态列表或地图等特权信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。