Skip to main content
QUICK REVIEW

[论文解读] Influence-Based Multi-Agent Exploration

Tonghan Wang, Jianhao Wang|arXiv (Cornell University)|Oct 12, 2019
Reinforcement Learning in Robotics参考文献 58被引用 5
一句话总结

本文提出了两种基于影响的多智能体探索方法——基于信息论影响的探索(EITI)和基于决策论影响的探索(EDTI)——通过互信息和一种新颖的交互价值(VoI)度量来协调去中心化的探索。通过将这些度量作为内在奖励正则项集成到策略梯度中,智能体能够学习发现并利用导致协调、高回报策略的交互点,从而在稀疏奖励的多智能体环境中实现有效探索。

ABSTRACT

Intrinsically motivated reinforcement learning aims to address the exploration challenge for sparse-reward tasks. However, the study of exploration methods in transition-dependent multi-agent settings is largely absent from the literature. We aim to take a step towards solving this problem. We present two exploration methods: exploration via information-theoretic influence (EITI) and exploration via decision-theoretic influence (EDTI), by exploiting the role of interaction in coordinated behaviors of agents. EITI uses mutual information to capture influence transition dynamics. EDTI uses a novel intrinsic reward, called Value of Interaction (VoI), to characterize and quantify the influence of one agent's behavior on expected returns of other agents. By optimizing EITI or EDTI objective as a regularizer, agents are encouraged to coordinate their exploration and learn policies to optimize team performance. We show how to optimize these regularizers so that they can be easily integrated with policy gradient reinforcement learning. The resulting update rule draws a connection between coordinated exploration and intrinsic reward distribution. Finally, we empirically demonstrate the significant strength of our method in a variety of multi-agent scenarios.

研究动机与目标

  • 解决过渡依赖型多智能体强化学习设置中稀疏奖励下探索方法的缺失问题。
  • 通过识别并访问状态-动作空间中的关键交互点,实现智能体的协调探索。
  • 开发反映一个智能体行为对其他智能体学习与性能影响的内在奖励机制。
  • 将基于影响的探索整合到策略梯度框架中,实现去中心化、可扩展的训练。
  • 在需要长期协调的复杂合作型多智能体任务中,验证方法的有效性。

提出的方法

  • 提出EITI,利用互信息(MI)量化智能体之间过渡动态中的相互依赖性。
  • 引入EDTI,采用一种新颖的交互价值(VoI)度量,衡量一个智能体行为对其他智能体预期回报的因果影响。
  • 将MI与VoI作为正则项融入策略梯度目标,以鼓励探索高影响状态。
  • 推导出增强的策略梯度更新规则,仅依赖轨迹即可进行梯度估计,支持端到端训练。
  • 通过基于影响度量分布化内在奖励计算,实现去中心化学习,无需集中协调。
  • 将协调探索与团队成员间内在奖励的分布相联系,解释学习效率的提升。

实验结果

研究问题

  • RQ1如何量化智能体间的影响,以支持在稀疏奖励环境下的有效多智能体探索?
  • RQ2互信息能否捕捉有意义的交互动态,从而指导多智能体系统中的协调探索?
  • RQ3与信息论度量相比,决策论度量如交互价值(VoI)是否能更优地识别高影响力交互?
  • RQ4在多智能体设置中,基于影响的内在奖励与标准好奇心或内在塑形方法相比表现如何?
  • RQ5基于影响的探索在多大程度上能发现子目标,并在复杂任务中实现长时程合作?

主要发现

  • 在Push-box、Island和Large-island等稀疏奖励合作型多智能体任务中,EITI与EDTI显著优于基线方法。
  • 在Push-box任务中,两种方法均成功学习到协调的多步推动策略,而所有基线方法均未能获得任何奖励。
  • 在Island任务中,EDTI使智能体能够发现并利用集体狩猎策略,即使面临寻宝带来的局部最优。
  • 在并非所有交互均带来性能提升的任务中,EDTI优于EITI,因其能有效过滤非有益交互。
  • 方法隐式发现了起子目标作用的高影响力状态,引导探索朝向高价值协调模式。
  • 实证结果表明,影响度量(MI与VoI)与有效探索相关,并在复杂环境中实现更快收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。