[論文レビュー] Agent Modelling under Partial Observability for Deep Reinforcement Learning
本稿では、他のエージェントの軌跡に直接アクセスせずに、自らのローカルな観測と行動からのみ、他のエージェントの行動を推論できるようにする、深層強化学習手法であるローカル情報エージェントモデリング(LIAM)を提案する。制御エージェントのローカルデータから、モデル化されたエージェントの観測と行動を再構成するエンコーダ・デコーダネットワークを訓練することで、協調的・競合的・混合のマルチエージェント環境において、完全観測が可能なベースラインと同等の報酬を達成するポリシー性能を向上させる。
Modelling the behaviours of other agents is essential for understanding how agents interact and making effective decisions. Existing methods for agent modelling commonly assume knowledge of the local observations and chosen actions of the modelled agents during execution. To eliminate this assumption, we extract representations from the local information of the controlled agent using encoder-decoder architectures. Using the observations and actions of the modelled agents during training, our models learn to extract representations about the modelled agents conditioned only on the local observations of the controlled agent. The representations are used to augment the controlled agent's decision policy which is trained via deep reinforcement learning; thus, during execution, the policy does not require access to other agents' information. We provide a comprehensive evaluation and ablations studies in cooperative, competitive and mixed multi-agent environments, showing that our method achieves higher returns than baseline methods which do not use the learned representations.
研究の動機と目的
- 実行時に他のエージェントの観測と行動にアクセス可能であると仮定する従来のエージェントモデリング手法の制限を解消すること。
- エージェントが限られた知覚と通信しか持たない部分観測環境において、効果的なエージェントモデリングを可能にすること。
- 制御エージェントのローカルな観測と行動からのみ、他のエージェントの行動の表現を学習する方法を開発すること。
- これらの学習済み表現を、深層強化学習を用いて制御エージェントの意思決定ポリシーに統合すること。
- 協調的・競合的・混合の多様なマルチエージェント環境において、本手法を評価すること。
提案手法
- 本手法は、制御エージェントのローカルな観測と行動から、モデル化対象エージェントの軌跡のコンact表現を学習するエンコーダ・デコーダアーキテクチャを用いる。
- 訓練中は、デコーダが符号化された表現を用いて、モデル化対象エージェントの観測と行動を再構成し、エンコーダは再構成誤差を最小化するように訓練される。
- 訓練後は、符号化器のみを保持し、制御エージェントのローカル状態と行動履歴に基づいて表現を生成する。
- これらの表現は、制御エージェントのポリシーの条件付けに用いられ、エージェントモデルと同時に深層強化学習(例:A2C)により訓練される。
- 変分的下界を用いず、β-VAE や MMD 正則化による複雑さを回避する再構成損失を用いてモデルを訓練する。
- 本手法は、ダブルスピーカー・リスナー、レベルベースのフォーリング、および変更された捕食者・獲物ゲームの3つの環境で評価される。
実験結果
リサーチクエスチョン
- RQ1実行時に制御エージェントが利用可能なローカル情報のみを用いて、効果的なエージェントモデリングが達成可能か?
- RQ2他のエージェントの軌跡を完全に観測できると仮定する手法と比較して、ローカル観測に基づくエージェントモデリングはどのように異なるか?
- RQ3学習済み表現は、協調的・競合的・混合のマルチエージェント環境において、制御エージェントのパフォーマンスを向上させられるか?
- RQ4符号化器の表現品質が、下流のポリシー性能に与える影響は何か?
- RQ5モデル化対象エージェントが制御エージェントの行動に反応しない場合、本手法の性能はどの程度に保たれるか?
主な発見
- LIAMは、エージェントモデリングを用いないベースライン手法と比較して、マルチエージェント環境におけるエピソード報酬を顕著に向上させる。
- 一部の環境では、A2CにLIAMを適用した平均報酬が、実行時にモデル化対象エージェントの完全な軌跡にアクセス可能な理想ベースライン(FIAM)とほぼ同等に達している。
- ダブルスピーカー・リスナー環境において、モデル化対象エージェントの反応を観測することで、制御エージェント自身の色を推論する能力を効果的に学習している。
- デコーダによる制御エージェントの色の再構成は時間経過とともに変化する:初期には不確実性が高く(値~0.3)、t=7で青にシフトし、一貫性のない反応を観測後に赤に修正される。
- 本手法は協調的・競合的・混合環境において良好に動作し、特定のタスクタイプに限定されない一般化能力を示している。
- モデル化対象エージェントが制御エージェントの行動に反応しない場合、モデル化対象エージェントの軌跡を推論する情報が得られず、LIAMは失敗する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。