Skip to main content
QUICK REVIEW

[論文レビュー] Exploration with Unreliable Intrinsic Reward in Multi-Agent Reinforcement Learning

Wendelin Böhmer, Tabish Rashid|arXiv (Cornell University)|Jun 5, 2019
Reinforcement Learning in Robotics参考文献 30被引用数 15
ひとこと要約

本論文は、分散型エージェントが共有された経験から学ぶ一方で、集中型エージェントが探索のための内因的報酬を受け取ることで、信頼性の低い内因的信号による干渉を回避する、マルチエージェント強化学習のための新規フレームワークICQLを提案する。この手法は学習を著しく加速し、部分的に観測可能な環境において最適方策への収束を可能にし、標準的な内因的報酬手法を上回る性能を発揮する。

ABSTRACT

This paper investigates the use of intrinsic reward to guide exploration in multi-agent reinforcement learning. We discuss the challenges in applying intrinsic reward to multiple collaborative agents and demonstrate how unreliable reward can prevent decentralized agents from learning the optimal policy. We address this problem with a novel framework, Independent Centrally-assisted Q-learning (ICQL), in which decentralized agents share control and an experience replay buffer with a centralized agent. Only the centralized agent is intrinsically rewarded, but the decentralized agents still benefit from improved exploration, without the distraction of unreliable incentives.

研究の動機と目的

  • 分散型マルチエージェント強化学習(MARL)における信頼性の低い内因的報酬の課題に対処すること。これは方策の誤導を引き起こし、最適な学習を妨げる。
  • 大規模な状態行動空間と部分的観測性のため訪問回数が信頼できない部分的に観測可能な環境における指向的探索を改善すること。
  • 分散型エージェントが不安定な内因的報酬に惑わされず、改善された探索の恩恵を受けるフレームワークを設計すること。
  • 訓練中にグローバル状態への集中型アクセスを活用することで、MARLにおけるより速く安定した学習を実現し、実行段階での分散性を保留すること。
  • ランダムまたは一様な探索を超える指向的探索を要する、挑戦的な捕食者・獲物グリッドワールド環境において、フレームワークを検証すること。

提案手法

  • 最後の層の活性化から得られる不確実性推定値に基づいて、探索を導くために内因的報酬を受ける集中型エージェントを導入する。
  • 集中型エージェントと分散型IQLエージェント間で共通の経験リプレイバッファを共有することで、知識の移転を可能にする。
  • エピソード開始時に集中型エージェントと分散型エージェントの間で50%の確率で切り替えることで、分布外サンプリングの問題を軽減する。
  • 分散型エージェントを環境報酬のみで訓練することで、最終的な方策が信頼性の低い内因的信号に影響されないことを保証する。
  • 集中型エージェントの内因的報酬をグローバル状態に条件づけることで、分散型エージェントよりも信頼性の高い不確実性推定が可能になる。
  • VDN や QMIX への潜在的な拡張を想定し、IQL などの価値ベースMARLアルゴリズムにこのフレームワークを適用する。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェントRLにおける信頼性の低い内因的報酬は、分散型エージェントが最適方策への収束を妨げることがあるか?
  • RQ2実行段階での分散性を損なわずに、グローバル状態への集中型アクセスが部分的に観測可能なMARL設定における探索をどのように改善するか?
  • RQ3集中型エージェントが内因的報酬を受け取る一方で、分散型エージェントが改善された探索の恩恵を受けることができるか? その際、同じ報酬に惑わされないか?
  • RQ4集中型と分散型エージェント間で経験と制御を共有することは、複雑な探索タスクにおけるより速く安定した学習をもたらすか?
  • RQ5提案されたICQLフレームワークは、学習速度と方策最適性の観点で、標準的な内因的報酬手法をどの程度上回るか?

主な発見

  • 標準的なIQLにおける内因的報酬の使用は、初期学習を加速させるが、信頼性の低いかつ混乱を招く信号のため、最適方策への収束を妨げる。
  • 学習プロットにおける緑色の曲線(IQLに内因的報酬を適用)は、学習が加速しているが、持続的な不安定性を示しており、信頼性の低い内因的報酬が方策を誤導していることを示している。
  • ICQLフレームワーク(青色の曲線)は、標準的なIQLよりも速く学習を進め、テストパフォーマンスの優位性から最適方策への収束を達成している。
  • 訓練中、集中型エージェントの内因的報酬による不安定性はIQLと類似しているが、これは最終的な分散型方策に影響しない。
  • テストパフォーマンスは、ICQLを介して訓練された分散型エージェントが最適なパフォーマンスを達成していることを確認しており、集中型エージェントの内因的報酬が最終方策を汚染していないことを示している。
  • 集中型と分散型制御の間で50%の確率で切り替える戦略により、学習が安定し、分布外サンプリングの問題が軽減されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。