Skip to main content
QUICK REVIEW

[論文レビュー] ZPD Teaching Strategies for Deep Reinforcement Learning from Demonstrations

Daniel Seita, David M. Chan|arXiv (Cornell University)|Oct 26, 2019
Reinforcement Learning in Robotics参考文献 32被引用数 8
ひとこと要約

本稿では、深層強化学習の示範学習において、複数の専門家デモンストレーターから動的に選択することで、サンプル効率を向上させるZPDに基づく教育戦略を提案する。学習者の現在の能力よりわずかに上回るスキルを持つ教師(最高の教師ではなく)を選択することで、9つのAtariゲームにおいて優れたサンプル効率と最終的なパフォーマンスを達成し、最適な教育は常に最高の専門家を使うのではなく、適切な距離の教師を選ぶことが重要であることを示している。

ABSTRACT

Learning from demonstrations is a popular tool for accelerating and reducing the exploration requirements of reinforcement learning. When providing expert demonstrations to human students, we know that the demonstrations must fall within a particular range of difficulties called the "Zone of Proximal Development (ZPD)". If they are too easy the student learns nothing, but if they are too difficult the student is unable to follow along. This raises the question: Given a set of potential demonstrators, which among them is best suited for teaching any particular learner? Prior work, such as the popular Deep Q-learning from Demonstrations (DQfD) algorithm has generally focused on single demonstrators. In this work we consider the problem of choosing among multiple demonstrators of varying skill levels. Our results align with intuition from human learners: it is not always the best policy to draw demonstrations from the best performing demonstrator (in terms of reward). We show that careful selection of teaching strategies can result in sample efficiency gains in the learner's environment across nine Atari games

研究の動機と目的

  • 複数の専門家デモンストレーターの中から最適に選択する方法を調査すること、すなわち単一の高パフォーマンスを示す教師に依存するのではなく、
  • 心理学的コンセプトの近接発達領域(ZPD)を深層強化学習に応用し、学習可能ながやや難しい例を提供すること。
  • 相対的スキルレベルに基づいて教師を動的に選択することで、オフポリシーの深層Q学習におけるサンプル効率と最終パフォーマンスを向上させること。
  • わずかに劣る教師(しかしZPD内)を使用することで、最高の専門家を使うよりも優れた学習結果が得られるかどうかを評価すること。

提案手法

  • 本手法は、学習者の相対的パフォーマンスと照らして、事前に訓練済みの専門家エージェントの集合から教師を選択する動的教師選択関数 $ f_{\rm select} $ を使用する。
  • 各訓練ステップで、学習者が現在の平均エピソード報酬よりもわずかに高いパフォーマンスを示す教師を選択する。
  • 学習者は自身のオンポリシー経験と、選択された教師からのオフポリシーのデモンストレーションを、共有された経験リプレイバッファに統合する。
  • 選択戦略は、'最高の先頭'(最高パフォーマンスの教師)、'kステップ先頭'(パフォーマンス順位でk番目以内の教師)、'ランダム先頭'(ZPD内の教師からランダムに選択)という関数の範囲で評価される。
  • 本手法は、経験リプレイを備えたダブルDQN(DDQN)フレームワーク内に実装されており、学習者と教師エージェントが共有経験から学習できる。
  • 本手法は9つのAtari 2600ゲームで評価され、異なる教師選択戦略における学習曲線と最終パフォーマンスの比較がなされた。

実験結果

リサーチクエスチョン

  • RQ1学習者の現在のスキルレベルに近い教師(ZPD)を選択することで、最高パフォーマンスの教師を使うよりもサンプル効率が向上するか?
  • RQ2パフォーマンス順位で'最高の先頭'、'5ステップ先頭'、'ランダム先頭'といった異なる教師選択戦略が、さまざまなAtariゲームでどのように異なるか?
  • RQ3わずかに劣る教師(しかしZPD内)を使用することで、特に複雑または非最適な専門家行動を示す環境では、より優れた教師を使うよりも学習が速くなるか?
  • RQ4ZPD内での教師選択をランダム化することで学習パフォーマンスにどのような影響があり、その多様性に測定可能な利点があるか?
  • RQ5オフポリシーの深層強化学習と経験リプレイを用いた文脈で、動的教師選択戦略は最終パフォーマンスとサンプル効率を向上させることができるか?

主な発見

  • '最高の先頭'戦略(最高パフォーマンスの教師を選択)は一貫して最高の結果をもたらさず、最後の100エピソード平均で唯一のゲーム(Pong)でトップだった。
  • Breakoutでは、'最高の先頭'と'10ステップ先頭'戦略が最も弱く、初期段階の学習者にとって非常に高度な教師は、不適切または混乱を招くデモンストレーションを提供する可能性がある。
  • '5ステップ先頭'戦略は複数のゲームで他の戦略を上回り、やや高い難易度と学習可能性のバランスを取るのに適していることが示された。
  • Space Invadersでは、'最高の先頭'法は常に報酬1007.5の教師を使用したが、'5ステップ先頭'法は最終スナップショットまで600から上昇する報酬の教師を使用しており、動的適応が行われた。
  • 'ランダム先頭'戦略は、ZPD内教師の報酬範囲が広く、教師選択の多様性がまだ完全には理解されていないが、利点を提供している可能性がある。
  • 全体として、最高パフォーマンスのデモンストレーターに依存することは非効率であり、ZPDに基づく教師選択は複数のAtari環境において顕著なサンプル効率の向上をもたらす。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。