Skip to main content
QUICK REVIEW

[论文解读] Intrinsic Motivation for Encouraging Synergistic Behavior

Rohan Chitnis, Shubham Tulsiani|arXiv (Cornell University)|Feb 12, 2020
Reinforcement Learning in Robotics参考文献 37被引用 5
一句话总结

该论文提出了一种新颖的内在动机机制,通过奖励那些无法通过单独智能体行为组合预测的联合动作,来促进多智能体强化学习中的协同行为。通过利用真实状态或联合训练的动力学模型下联合预测与组合预测之间的差异,该方法在稀疏奖励环境下,尤其在双臂操作和多智能体运动等任务中,显著提升了学习效率,优于仅使用稀疏奖励或基于惊喜的内在奖励的方法。

ABSTRACT

We study the role of intrinsic motivation as an exploration bias for reinforcement learning in sparse-reward synergistic tasks, which are tasks where multiple agents must work together to achieve a goal they could not individually. Our key idea is that a good guiding principle for intrinsic motivation in synergistic tasks is to take actions which affect the world in ways that would not be achieved if the agents were acting on their own. Thus, we propose to incentivize agents to take (joint) actions whose effects cannot be predicted via a composition of the predicted effect for each individual agent. We study two instantiations of this idea, one based on the true states encountered, and another based on a dynamics model trained concurrently with the policy. While the former is simpler, the latter has the benefit of being analytically differentiable with respect to the action taken. We validate our approach in robotic bimanual manipulation and multi-agent locomotion tasks with sparse rewards; we find that our approach yields more efficient learning than both 1) training with only the sparse reward and 2) using the typical surprise-based formulation of intrinsic motivation, which does not bias toward synergistic behavior. Videos are available on the project webpage: https://sites.google.com/view/iclr2020-synergistic.

研究动机与目标

  • 为解决在稀疏奖励环境下多智能体强化学习中的高效探索挑战,其中协同行为至关重要但难以发现。
  • 开发一种内在动机机制,专门偏向学习协同动作,而非一般性好奇心或惊喜。
  • 实现在双臂操作和多智能体运动等复杂任务中的样本高效学习,这些任务中单个智能体无法独立达成目标。
  • 探索利用联合训练的动力学模型中的解析梯度,以提高策略梯度框架中的优化效率。
  • 将该方法扩展至两个以上智能体,并在日益复杂的协作环境中验证其有效性。

提出的方法

  • 提出两种内在奖励公式:一种基于真实联合效应与个体智能体行为组合预测之间的差异,另一种使用联合训练的动力学模型以获得解析梯度。
  • 使用联合前向模型 $ f^{\text{joint}} $ 预测联合动作的真实结果,并与由个体智能体模型构建的组合预测 $ f^{\text{composed}} $ 进行比较。
  • 将内在奖励 $ r_1^{\text{intrinsic}} $ 定义为使用真实状态时,真实预测与组合预测之间的L2差异。
  • 将 $ r_2^{\text{intrinsic}} $ 定义为联合模型与组合模型预测之间的差异,从而实现通过动作的反向传播。
  • 将内在奖励集成到策略梯度框架中,支持端到端训练并提升样本效率。
  • 通过按顺序组合预测并评估所有排列方式,将方法扩展至三个智能体,以降低对顺序的敏感性。

实验结果

研究问题

  • RQ1基于非可组合联合效应的内在动机是否能提升协同多智能体任务中稀疏奖励下的学习效率?
  • RQ2基于联合预测与组合预测差异的公式是否优于基于惊喜的内在奖励,以促进协同行为?
  • RQ3来自联合训练动力学模型的解析梯度是否能提升策略梯度训练中的样本效率?
  • RQ4该方法在多于两个智能体场景下的可扩展性如何?组合预测的顺序是否影响性能?
  • RQ5在无外在奖励的情况下,内在奖励是否仍能引导智能体学习协同行为?

主要发现

  • 所提出的内在动机方法在所有六个模拟任务中,显著优于仅使用稀疏外在奖励的训练方法,包括双臂操作和多智能体运动任务。
  • 该方法也优于基于惊喜的内在奖励,后者未明确鼓励协同行为,在协同任务中表现较差。
  • 使用解析梯度的公式($ r_2^{\text{intrinsic}} $)相比不可微分版本($ r_1^{\text{intrinsic}} $)实现了更高的样本效率,学习曲线显示收敛更快。
  • 在三智能体环境(蚂蚁推物和足球)中,该方法保持了强劲性能,证明其可扩展至两个以上智能体。
  • 当在无外在奖励($ \lambda = 0 $)下训练时,智能体仍能学习协同行为,尽管不一定会解决任务,证实了内在奖励引导探索朝向合作。
  • 消融实验表明,预训练联合模型在惊喜基线中并未提升性能,确认关键优势源于协同偏差,而非模型容量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。