Skip to main content
QUICK REVIEW

[論文レビュー] Learning Hierarchical Teaching Policies for Cooperative Agents

Dong Ki Kim, Miao Liu|arXiv (Cornell University)|Mar 7, 2019
Reinforcement Learning in Robotics参考文献 43被引用数 8
ひとこと要約

本稿では、階層的強化学習と拡張された行動シーケンスを用いて、高水準で転送可能な指導方策を学習できる、深層強化学習フレームワークである階層的マルチエージェント指導(HMAT)を紹介する。HMATは、複雑で高次元な環境における教師の貢献度割り当ての課題を克服し、従来の手法と比較してチーム全体の学習を顕著に加速する。

ABSTRACT

Collective learning can be greatly enhanced when agents effectively exchange knowledge with their peers. In particular, recent work studying agents that learn to teach other teammates has demonstrated that action advising accelerates team-wide learning. However, the prior work has simplified the learning of advising policies by using simple function approximations and only considered advising with primitive (low-level) actions, limiting the scalability of learning and teaching to complex domains. This paper introduces a novel learning-to-teach framework, called hierarchical multiagent teaching (HMAT), that improves scalability to complex environments by using the deep representation for student policies and by advising with more expressive extended action sequences over multiple levels of temporal abstraction. Our empirical evaluations demonstrate that HMAT improves team-wide learning progress in large, complex domains where previous approaches fail. HMAT also learns teaching policies that can effectively transfer knowledge to different teammates with knowledge of different tasks, even when the teammates have heterogeneous action spaces.

研究の動機と目的

  • 複雑で高次元な協調的マルチエージェント環境における、従来の行動助言手法のスケーラビリティの制限を解消すること。
  • 助言シーケンスが学生の学習進捗に与える影響を推定することで、マルチエージェント指導における教師の貢献度割り当て問題を克服すること。
  • 異なった行動空間や異なるタスク要件を持つエージェント間で、効果的な知識転送を可能にすること。
  • 時間的に拡張された部分的目標と深層的方策表現を用いる階層的指導フレームワークを構築し、学習効率を向上させること。

提案手法

  • HMATは、教師が原始的行動(すなわち、部分的目標)の時間的に拡張されたシーケンスを用いて助言できるようにするため、階層的強化学習(HRL)を採用する。
  • 本フレームワークは、マネージャーレベルの方策が部分的目標を生成し、ワーカーレベルの方策が原始的行動を実行し、助言レベレルの方策が何を、いつ助言するかを決定するという、多段階のポリシー構造を用いる。
  • 教師の貢献度に寄与する各助言シーケンスの寄与度を推定する、新しい貢献度割り当てメカニズムを採用し、教師方策の安定した学習を可能にする。
  • 助言タイミングの離散的決定を勾配逆伝播可能にするために、Gumbel-Softmax推定器を助言レベル方策が用い、エンドツーエンドの学習を可能にする。
  • 学生方策を深層ニューラルネットワークで表現することで、大規模な状態-行動空間や長時間のタスクに対してもスケーラブルなフレームワークを実現する。
  • 事前学習されたワーカーポリシーは固定され、マネージャーレベル方策は学生を導く部分的目標を生成するように訓練され、助言はマネージャーレベルで行われる。

実験結果

リサーチクエスチョン

  • RQ1従来の手法が失敗するような、複雑で高次元な協調的マルチエージェント環境において、階層的指導フレームワークは学習効率を向上させることができるか?
  • RQ2原始的行動ではなく、拡張された行動シーケンスによる助言では、教師の貢献度をどのように正確に推定できるか?
  • RQ3異なる行動空間や異なるタスクを持つチームメイトに対して、教師方策が知識をどれだけ効果的に転送できるか?
  • RQ4階層的方策と深層的表現を用いることで、より速く安定したチーム全体の学習進行が達成できるか?

主な発見

  • HMATは、従来の手法が収束しない複雑なドメイン(COBPおよびCTBP)において、チーム全体の学習進行を顕著に加速する。
  • 異なる行動空間を持つチームメイトに対しても、効果的な知識転送が可能であり、指導方策の優れた一般化性と転送可能性を示している。
  • 実験的結果から、CR(貢献度に基づく報酬)教師報酬関数を用いたHMATは、代替の報酬関数やベースライン手法よりも学習速度と安定性において優れている。
  • 拡張された助言シーケンスと階層的方策の使用により、収束が早くなり、トレーニングスレッド数が増えるほど教師方策の学習もより速く収束する。
  • ワーカーポリシーの事前学習とトレーニング中の固定化により、学習が安定化し、マネージャーレベルの指導方策が高水準の部分的目標生成と助言タイミングの最適化に集中できるようになる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。