Skip to main content
QUICK REVIEW

[論文レビュー] Diversity-Enriched Option-Critic

Anand Kamat, Doina Precup|arXiv (Cornell University)|Nov 4, 2020
Reinforcement Learning in Robotics参考文献 31被引用数 6
ひとこと要約

本稿では、情報理論的内在的報酬と新たな終了目的関数を導入することで、オプション・クリティックフレームワークを拡張し、オプション間の行動の多様性を促進するエンドツーエンド強化学習手法であるDiversity-Enriched Option-Critic (DEOC)を提案する。この手法は、離散的および連続的制御タスクにおいて、オプション・クリティックおよびPPOを著しく上回り、強固で解釈可能かつ再利用可能なオプションを生成する。

ABSTRACT

Temporal abstraction allows reinforcement learning agents to represent knowledge and develop strategies over different temporal scales. The option-critic framework has been demonstrated to learn temporally extended actions, represented as options, end-to-end in a model-free setting. However, feasibility of option-critic remains limited due to two major challenges, multiple options adopting very similar behavior, or a shrinking set of task relevant options. These occurrences not only void the need for temporal abstraction, they also affect performance. In this paper, we tackle these problems by learning a diverse set of options. We introduce an information-theoretic intrinsic reward, which augments the task reward, as well as a novel termination objective, in order to encourage behavioral diversity in the option set. We show empirically that our proposed method is capable of learning options end-to-end on several discrete and continuous control tasks, outperforms option-critic by a wide margin. Furthermore, we show that our approach sustainably generates robust, reusable, reliable and interpretable options, in contrast to option-critic.

研究の動機と目的

  • オプション・クリティックフレームワークにおけるオプション崩壊問題(複数のオプションが同一または冗長な行動を学習する)を解決すること。
  • 内在的動機付けによる多様でタスク関連のオプション方策の促進により、探索と学習効率を向上させること。
  • 1つのオプションが優位を占めるのを防ぎ、多様なオプションの探索を維持するように、探索を促進する終了目的関数を設計すること。
  • 明示的な報酬形状付けや手動による開始セット設計なしに、再利用可能で解釈可能で強固なオプションを学習可能とすること。
  • 離散的および連続的制御タスクにおいて、オプションの解釈可能性を維持したまま最先端のパフォーマンスを達成すること。

提案手法

  • 学習済みオプションの方策における多様性を促進する情報理論的内在的報酬を導入し、異なる行動戦略の探索を促進する。
  • オプション価値の比較に基づく新たな終了目的関数を提案し、劣悪なオプションの終了を遅らせて探索を維持し、早期に優位を占めるのを防ぐ。
  • 標準的なタスク報酬に内在的多様性ボーナスを加算し、タスクパフォーマンスとオプション多様性の両方を同時に最適化する。
  • 勾配ベースのポリシー学習を用いて、モデルフリー設定下でオプション方策と終了関数をエンドツーエンドで訓練する。
  • 各オプションがタスクリターンと多様性インcentiveの組み合わせ目的関数を最大化するように学習する、マルチオプションポリシー勾配フレームワークを採用する。
  • MuJoCo環境や表形式タスクを含む標準的な制御ベンチマークにこの手法を適用し、ドメインをまたがる一般化を実証する。

実験結果

リサーチクエスチョン

  • RQ1オプション・クリティックフレームワークにおいて、行動の多様性に基づく内在的報酬がオプション学習を改善できるか?
  • RQ2学習中に劣悪なオプションを保持する新たな終了目的関数は、より強固で多様なオプション集合をもたらすか?
  • RQ3オプション方策における多様性は、複雑な制御タスクにおけるより高いサンプル効率と最終パフォーマンスをもたらすか?
  • RQ4学習済みオプションは、トランスファーラーニングのシナリオにおいて、どの程度解釈可能で再利用可能か?
  • RQ5オプション・クリティックおよびPPOと比較して、本手法はパフォーマンス、強度、およびオプション品質の観点でどのように優れているか?

主な発見

  • 提案手法TDEOCは、評価されたすべての連続的制御タスクで最先端のパフォーマンスを達成し、オプション・クリティックおよびPPOを上回る。
  • TMaze転送タスクにおいて、目標変更後もTDEOCはオプション・クリティックを上回る最終パフォーマンスを示し、優れた強度と適応性を示した。
  • 可視化結果から、TDEOCにおけるオプションの終了が、意思決定ポイント(例:TMazeの縦型通路やHopper-v2の空中状態)に局在していることが確認され、直感的で目的指向の行動を示している。
  • OneRoom環境では、1つのオプションが部屋をスキャンし、もう1つのオプションがゴールへ向かうというように、補完的で解釈可能な役割を果たしている。
  • 手動による報酬形状付けや明示的な開始セット設計なしに、タスクをまたいで一貫して多様で信頼性があり再利用可能なオプションを生成した。
  • 実験的結果から、内在的多様性報酬と新たな終了目的関数が併用されることで、探索が促進され、オプション崩壊が防止されることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。