Skip to main content
QUICK REVIEW

[論文レビュー] Agent-Temporal Attention for Reward Redistribution in Episodic Multi-Agent Reinforcement Learning

Baicen Xiao, Bhaskar Ramasubramanian|arXiv (Cornell University)|Jan 12, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、エピソード型マルチエージェント強化学習における密な報酬再配分のための注目メカニズムに基づくARELを提案する。時間的注目(軌跡全体の注目)とエージェント注目(連携状態の注目)を組み合わせることで、ARELは重要な状態を特定し、エピソード全体の報酬を再配分することで、信用割り当てを改善し、Particle WorldおよびStarCraftの最先端手法と比較してより高い累積報酬とWinレートを達成する。

ABSTRACT

This paper considers multi-agent reinforcement learning (MARL) tasks where agents receive a shared global reward at the end of an episode. The delayed nature of this reward affects the ability of the agents to assess the quality of their actions at intermediate time-steps. This paper focuses on developing methods to learn a temporal redistribution of the episodic reward to obtain a dense reward signal. Solving such MARL problems requires addressing two challenges: identifying (1) relative importance of states along the length of an episode (along time), and (2) relative importance of individual agents' states at any single time-step (among agents). In this paper, we introduce Agent-Temporal Attention for Reward Redistribution in Episodic Multi-Agent Reinforcement Learning (AREL) to address these two challenges. AREL uses attention mechanisms to characterize the influence of actions on state transitions along trajectories (temporal attention), and how each agent is affected by other agents at each time-step (agent attention). The redistributed rewards predicted by AREL are dense, and can be integrated with any given MARL algorithm. We evaluate AREL on challenging tasks from the Particle World environment and the StarCraft Multi-Agent Challenge. AREL results in higher rewards in Particle World, and improved win rates in StarCraft compared to three state-of-the-art reward redistribution methods. Our code is available at https://github.com/baicenxiao/AREL.

研究の動機と目的

  • 協調的マルチエージェント強化学習における遅延的またはエピソード型報酬の課題に対処すること。この場合、エージェントはエピソード終了時にのみグローバル報酬を受ける。
  • エピソードの時間軸に沿った状態の相対的重要性(時間的次元)と、各時刻におけるエージェント間の重要度(エージェント次元)を特定することで、信用割り当てを改善すること。
  • マルチエージェント設定における共同観測空間の爆発を回避する、スケーラブルな注目ベースの手法を開発すること。
  • 任意の価値ベースのMARLアルゴリズム(例:QMIXやMADDPG)と統合可能であり、学習可能な密な報酬信号を生成することで、既存のMARLアルゴリズムへの統合を可能にすること。
  • 効果的な報酬再配分が、エピソード型MARL環境において戦略的探索を上回ることを示すこと。

提案手法

  • ARELは、各エージェントの個別観測系列を処理する共有時間的注目モジュールを採用し、長期依存関係をモデル化し、影響力のある状態遷移を特定する。
  • エージェント注目モジュールを用いて、各時刻における各エージェントの状態がグローバル報酬に与える相対的寄与度を、エージェント間の注目重みに基づき計算する。
  • エージェント注目モジュールの出力を用い、各時刻における各エージェントのための密な、時間的に再配分された報酬信号を生成する。
  • 損失関数に分散に基づく正則化項を統合し、重要状態においてスパースだが意味のある報酬配分を促進する。
  • 再配分された報酬は、QMIXやMADDPGなどの任意の価値ベースのMARLアルゴリズムと互換性があり、プラグアンドプレイ統合が可能である。
  • ARELは根本的なMARLポリシーを変更しない。代わりに、学習効率を向上させるための報酬形状モジュールとして機能する。

実験結果

リサーチクエスチョン

  • RQ1注目メカニズムは、エピソード報酬を伴う長時間スケールのMARLタスクにおいて、重要な状態を効果的に特定できるか?
  • RQ2共同観測処理を必要とせずに、スケーラブルな方法で時間的およびエージェント別信用割り当てを統合的にモデル化できるか?
  • RQ3注目を用いた密な報酬再配分は、最先端の信用割り当て手法と比較して、学習性能を向上させるか?
  • RQ4効果的な報酬再配分は、エピソード型MARL環境において、どの程度戦略的探索を上回るか?
  • RQ5注目メカニズムは、タスクの目的と整合する解釈可能で意味のある報酬信号を学習できるか?

主な発見

  • Particle World環境において、ARELは3つの最先端報酬再配分手法を上回る高い累積報酬を達成し、学習効率の向上を示した。
  • StarCraft Multi-Agent Challengeにおいて、ARELはベースライン手法と比較してWinレートを向上させ、エピソード報酬下でのより良いポリシー学習を示した。
  • ARELが生成した再配分報酬はエピソード全体で一様ではなく、エージェントが効果的に協調した状態(例:異なるランドマークへ向かって移動する状態)に対して高い値が割り当てられていた。
  • 可視化結果から、ARELの注目メカニズムは、エージェントが異なるランドマークをカバーした際に高い報酬を割り当てるよう学習しており、タスクの目的と整合していた。
  • 実験から、特に報酬が遅延する状況では、効果的な報酬再配分が戦略的探索(例:MAVEN)よりも有益であることが明らかになった。
  • 共同観測処理を必要とせず、マルチエージェント設定においてもスケーラブルに動作し、計算効率を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。