Skip to main content
QUICK REVIEW

[論文レビュー] Variational Autoencoders for Opponent Modeling in Multi-Agent Systems

Georgios Papoudakis, Stefano V. Albrecht|arXiv (Cornell University)|Jan 29, 2020
Reinforcement Learning in Robotics参考文献 30被引用数 5
ひとこと要約

本稿では、実行時における相手の内部状態へのアクセスを不要とする、局所的観測、行動、報酬のみを用いて効果的な相手表現を学習する、VAEに基づく新規なオピニオンモデリング手法SMA2Cを提案する。ベースライン手法が相手の全軌道にアクセスを必要とするのに対し、SMA2Cは同等またはそれ以上のエピソード報酬を達成しており、最小限の外部情報のみで頑健な相手モデリングが可能であることを示している。

ABSTRACT

Multi-agent systems exhibit complex behaviors that emanate from the interactions of multiple agents in a shared environment. In this work, we are interested in controlling one agent in a multi-agent system and successfully learn to interact with the other agents that have fixed policies. Modeling the behavior of other agents (opponents) is essential in understanding the interactions of the agents in the system. By taking advantage of recent advances in unsupervised learning, we propose modeling opponents using variational autoencoders. Additionally, many existing methods in the literature assume that the opponent models have access to opponent's observations and actions during both training and execution. To eliminate this assumption, we propose a modification that attempts to identify the underlying opponent model using only local information of our agent, such as its observations, actions, and rewards. The experiments indicate that our opponent modeling methods achieve equal or greater episodic returns in reinforcement learning tasks against another modeling method.

研究の動機と目的

  • 実行時における相手の観測や行動へのアクセスを必要とする従来のオピニオンモデリング手法の制限を解消すること。
  • マルチエージェント環境において未観測の相手に一般化可能な強化学習エージェントの開発。
  • エージェント自身の経験からの局所的情報のみを用いて、効果的なオピニオンモデリングが可能かどうかの調査。
  • 識別目的関数が埋め込み品質および下流の強化学習性能に与える影響の評価。

提案手法

  • 訓練および推論に相手の全軌道(観測、行動)を用いるVAEベースのオピニオンモデルOMDDPGを提案する。
  • エージェント自身の観測、行動、報酬、終了信号のみに条件づけられたエンコーダーを用いることで、相手行動を推論する、変更されたVAEアーキテクチャSMA2Cを導入する。
  • 再パrameterizationトリックを用いた変分推論フレームワークを採用し、確率的勾配降下法を用いてVAEをエンドツーエンドで訓練する。
  • Groverら(2018a)にインspiredされた対照的損失(識別目的関数)を組み込み、異なる相手の表現が分離され、クラスタリング可能になるように促進する。
  • 学習済み表現と相手のアイデンティティとの間の統計的依存性を評価するために、相互情報量ニューラル推定(MINE)を用いる。
  • マルチエージェントパーティクル環境(MPE)およびトロイ協調タスクでモデルを訓練・評価し、弱一般化および強一般化設定下でのエピソード報酬を測定する。

実験結果

リサーチクエスチョン

  • RQ1実行時において相手の内部状態(例:観測、行動)へのアクセスが全くない状況でも、オピニオンモデリングは有効に機能するか?
  • RQ2相手の全軌道ではなく、エージェント自身の局所的情報のみを用いて訓練されたオピニオンモデルの性能は、全軌道を用いるモデルと比べてどうか?
  • RQ3識別目的関数が、学習済みオピニオン表現の品質および下流の強化学習性能に与える寄与度は何か?
  • RQ4異なる入力コンponents(例:報酬、終了信号)が、一般化下でのオピニオンモデルの頑健性に与える影響はどの程度か?
  • RQ5表現内の相互情報量と、実際の強化学習タスクにおけるエピソード報酬との間に相関関係があるか?

主な発見

  • SMA2Cは、推論時に相手の観測や行動を一切使用しないにもかかわらず、OMDDPGおよびGroverら(2018a)の手法と同等またはそれ以上のエピソード報酬を達成している。
  • 識別目的関数は、スピーカーリスナーやダブルスピーカーリスナー環境において、特に強一般化条件下で性能を顕著に向上させている。
  • 報酬および終了信号を含まないSMA2Cは、弱一般化条件下では完全なモデルと同等の性能を示すが、複雑な環境における強一般化条件下では性能が低下する。
  • SMA2Cで観測と行動のみを用いる場合、大多数の環境で完全なモデルと同等の性能を達成するが、捕食者・獲物環境では性能が低下する。
  • 識別目的関数を備えたモデルでは、表現と相手アイデンティティとの間の相互情報量が高くなるが、これは必ずしもより良い強化学習報酬に直結しない。
  • これらの結果は、相手モデリングがエージェント自身の局所的経験のみを用いても有効に可能であることを示しており、全相手軌道へのアクセスが必須であるという仮定に疑問を呈している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。