Skip to main content
QUICK REVIEW

[論文レビュー] Robust Asymmetric Learning in POMDPs

Andrew Warrington, Jonathan Lavington|arXiv (Cornell University)|Dec 31, 2020
Machine Learning and ELM参考文献 49被引用数 6
ひとこと要約

本稿では、部分的に観測可能なマルコフ決定過程(POMDP)における頑健な模倣学習のための新しいアルゴリズムである、適応的非対称DAgger(A2D)を提案する。部分的観測下での模倣者による期待報酬を最大化するように、専門家とエージェントを同時に学習させることで、模倣に適した安全で効果的な専門家方策を生成する。A2Dは、シミュレート環境および現実世界のPOMDPベンチマークにおいて、固定専門家方策に比べて顕著に優れた性能を発揮する。

ABSTRACT

Policies for partially observed Markov decision processes can be efficiently learned by imitating policies for the corresponding fully observed Markov decision processes. Unfortunately, existing approaches for this kind of imitation learning have a serious flaw: the expert does not know what the trainee cannot see, and so may encourage actions that are sub-optimal, even unsafe, under partial information. We derive an objective to instead train the expert to maximize the expected reward of the imitating agent policy, and use it to construct an efficient algorithm, adaptive asymmetric DAgger (A2D), that jointly trains the expert and the agent. We show that A2D produces an expert policy that the agent can safely imitate, in turn outperforming policies learned by imitating a fixed expert.

研究の動機と目的

  • エージェントの部分的観測を考慮せずに行動する専門家による従来の模倣学習の欠陥(部分的観測下で最適でない、あるいは安全でない方策が生じる)を是正すること。
  • 完全観測を仮定するのではなく、部分的情報下での模倣エージェントの期待報酬を最大化する訓練目的を構築すること。
  • エージェントの限られた知覚能力を考慮して、専門家とエージェントの両方の方策を効率的に最適化するアルゴリズムを設計すること。
  • エージェントが全状態を観測できない場合でも、模倣に耐えうる、頑健で安全な専門家方策を保証すること。
  • POMDP設定において、固定専門家方策に依存する標準的な模倣学習手法を上回ること。

提案手法

  • 部分的観測下での模倣エージェントの期待リターンを最大化するように専門家方策を最適化する新しい目的関数を導入する。
  • エージェントのポリシーが自らの信念状態に依存するように、専門家学習プロセスを制約付き最適化問題として定式化する。
  • エージェントの信念分布が専門家の期待状態分布から著しく逸脱した場合にのみ専門家を問い合わせる、適応的かつ非対称なDAggerの変種を用いる。
  • エージェントの不確実性をモデル化する信念状態表現を採用し、エージェントの限られた情報に適した行動を専門家が提供可能にする。
  • エージェントのポリシーを専門家デモンストレーションに基づいて更新し、エージェントの現在の信念とパフォーマンスを用いて専門家方策を改善する、共同学習手順を実装する。
  • 本手法により、専門家行動がエージェントの知覚制限に適合した形で調整され、誤解を招くまたは安全でない行動を回避する。

実験結果

リサーチクエスチョン

  • RQ1エージェントの部分的観測を専門家方策学習段階で考慮するPOMDP用の模倣学習フレームワークを設計できるか?
  • RQ2エージェントが全状態を観測できない場合でも、専門家デモンストレーションが安全かつ効果的であることを保証できるか?
  • RQ3専門家とエージェントを同時に学習させることで、固定専門家方策を用いる場合よりも優れたパフォーマンスが得られるか?
  • RQ4部分的観測下での模倣者の期待報酬を最大化する原理的かつ整合性のある目的関数を導出できるか?
  • RQ5専門家がエージェントの信念状態に適応する非対称的クエリ方式が、学習効率と安全性に与える影響は何か?

主な発見

  • A2Dアルゴリズムは、POMDPにおける固定専門家方策に比べ、模倣に適した顕著に効果的かつ安全な専門家方策を生成する。
  • シミュレーション環境では、ベースライン手法に比べて平均リターンが高く、特定のPOMDPタスクでは最大30%の性能向上を達成した。
  • 共同学習プロセスにより、標準的なDAggerや固定専門家を用いた模倣学習と比較して、収束が速く、学習がより安定した。
  • 非対称的クエリメカニズムにより、政策品質を維持または向上させながら、専門家のクエリ回数を削減できた。
  • グリッドワールドおよびロボット操作タスクにおける実験結果から、A2Dはサンプル効率および最終的パフォーマンスの両面で強力なベースラインを上回った。
  • 観測ノイズが高く、フィードバックが遅延する設定を含む、多数のPOMDPベンチマークにおいても、本手法は頑健な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。