Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Deep Reinforcement Learning via Adaptive Policy Transfer

Tianpei Yang, Jianye Hao|arXiv (Cornell University)|Feb 19, 2020
Reinforcement Learning in Robotics参考文献 32被引用数 5
ひとこと要約

本稿では、マルチポリシー転送をオプション学習問題としてモデル化することで、ターゲットタスク学習中にソースポリシーの適応的選択と動的終了を可能にする、新しいポリシー転送フレームワーク(PTF)を提案する。既存のディープ強化学習アルゴリズムと統合することで、タスクの類似度を明示的に測定する必要なく、離散的および連続的制御タスクの両方で、最先端の転送手法を凌駕する学習の高速化を実現する。

ABSTRACT

Transfer Learning (TL) has shown great potential to accelerate Reinforcement Learning (RL) by leveraging prior knowledge from past learned policies of relevant tasks. Existing transfer approaches either explicitly computes the similarity between tasks or select appropriate source policies to provide guided explorations for the target task. However, how to directly optimize the target policy by alternatively utilizing knowledge from appropriate source policies without explicitly measuring the similarity is currently missing. In this paper, we propose a novel Policy Transfer Framework (PTF) to accelerate RL by taking advantage of this idea. Our framework learns when and which source policy is the best to reuse for the target policy and when to terminate it by modeling multi-policy transfer as the option learning problem. PTF can be easily combined with existing deep RL approaches. Experimental results show it significantly accelerates the learning process and surpasses state-of-the-art policy transfer methods in terms of learning efficiency and final performance in both discrete and continuous action spaces.

研究の動機と目的

  • 既存のポリシー転送手法が明示的なタスク類似度測定に依存するか、完全なソースポリシーを仮定するという制限を克服すること。
  • 手動でのポリシーライブラリ構築を必要とせず、ターゲットタスク学習中に複数のソースポリシーを効率的かつ適応的に再利用できること。
  • 動的かつ適切なタイミングでソースポリシーの使用を切り替えたり終了したりすることで、負の転送を防ぐこと。
  • 価値ベースおよびポリシー基地の両方の既存ディープ強化学習アルゴリズムとシームレスに統合できること。
  • 大規模な状態・行動空間を有する複雑な環境において、学習効率と最終パフォーマンスを向上させること。

提案手法

  • 各ソースポリシーが独自のポリシーと終了条件を持つオプションに対応するオプション学習問題としてポリシー転送をモデル化すること。
  • ターゲットポリシーの元の目的と選択されたソースポリシーの模倣のバランスを取るために、動的重み係数 f(βₒ,t) を導入すること。
  • A3C や PPO などの標準的なディープ強化学習アルゴリズムを用いて、オプションポリシーと終了条件をエンドツーエンドで学習すること。
  • 終了確率をパフォーマンス指標として用いることで、劣悪または有害なソースポリシーの長時間利用を回避すること。
  • 現在の有用性に基づいてソースポリシーを優先順位付けするヒューリスティック機構を採用し、オプション間の自動切り替えを可能にすること。
  • ソースポリシー知識を補助最適化目的として形式的に統合することで、単一のポリシーが完全に最適でない場合でも部分的な知識転送が可能になるようにすること。

実験結果

リサーチクエスチョン

  • RQ1マルチポリシー転送をオプション学習問題として効果的にモデル化できるか、これによりソースポリシーの適応的再利用が可能になるか?
  • RQ2フレームワークは、負の転送を防ぐために、どのようにしてソースポリシー使用の動的選択と終了を実現するか?
  • RQ3提案手法は、離散的および連続的制御タスクの両方で学習効率と最終パフォーマンスを向上させることができるか?
  • RQ4重み係数 f(βₒ,t) は、ターゲットポリシー最適化とソースポリシー模倣のバランスにどのように影響を与えるか?
  • RQ5ソースポリシーが部分的にしか有用でない環境において、フレームワークはどの程度一般化可能か?

主な発見

  • PTFは、ディスクリート(グリッドワールド)および連続的(Reacher)制御タスクにおいて、ヴァニラDRL手法と比較して学習を顕著に高速化する。
  • グリッドワールド環境では、ソースタスクとターゲットタスクの類似度が部分的であっても、deep-CAPS や他の転送ベースラインを上回る性能を発揮する。
  • Reacherタスクでは、PTF-A3C および PTF-PPO が A3C や PPO ベースラインを常に上回る平均割引報酬を達成する。
  • アブレーションスタディの結果、重み係数 f(βₒ,t) が極めて重要であることが確認された。これがないと、ソースポリシー模倣への過剰依存により性能が低下する。
  • オプション切り替え頻度は時間経過とともに減少しており、PTFが適切なタイミングで最も効果的なソースポリシーを適切に特定して使用していることが示された。
  • フレームワークは連続的アクション空間に対しても良好に一般化され、deep-CAPS とは異なり、手動で追加されたプリミティブポリシーを必要としない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。