Skip to main content
QUICK REVIEW

[論文レビュー] Policy Evaluation Networks

Jean Harb, Tom Schaul|arXiv (Cornell University)|Feb 26, 2020
Reinforcement Learning in Robotics参考文献 43被引用数 14
ひとこと要約

本稿では、ポリシーをコンパクトで情報豊富なフィンガープrintに埋め込むことで、新たな環境インタラクションを必要とせずにその期待リターンを予測できる微分可能フレームワーク、ポリシーアイテーションネットワーク(PVN)を提案する。PVNをポリシー・リターンのペアで訓練し、ネットワークを通じてゼロショットのポリシー勾配上昇を可能にすることで、学習データ内のポリシーを上回る優れたポリシーが生成され、ポリシースペース全体にわたる優れた一般化が実証された。

ABSTRACT

Many reinforcement learning algorithms use value functions to guide the search for better policies. These methods estimate the value of a single policy while generalizing across many states. The core idea of this paper is to flip this convention and estimate the value of many policies, for a single set of states. This approach opens up the possibility of performing direct gradient ascent in policy space without seeing any new data. The main challenge for this approach is finding a way to represent complex policies that facilitates learning and generalization. To address this problem, we introduce a scalable, differentiable fingerprinting mechanism that retains essential policy information in a concise embedding. Our empirical results demonstrate that combining these three elements (learned Policy Evaluation Network, policy fingerprints, gradient ascent) can produce policies that outperform those that generated the training data, in zero-shot manner.

研究の動機と目的

  • 未学習のポリシーの期待リターンを予測できるように学習することで、ポリシースペースにおける直接的なポリシー最適化を可能にすること。
  • 構造的および行動的情報を保持するが、コンパクトで微分可能な形で複雑なポリシーを表現する課題に対処すること。
  • 学習済み価値関数を用いたポリシー空間におけるゼロショットのポリシー改善手法を開発し、最適化中にオンラインのロールアウトを必要としないこと。
  • 状態・行動空間からポリシー・パrameter空間へのインダクティブ・バイアスのシフトにより、強化学習におけるデータ効率性と一般化性能を向上させること。

提案手法

  • ポリシーのフィンガープリントからその期待リターンを予測するように訓練された、順伝播型ニューラルネットワークであるポリシーアイテーションネットワーク(PVN)を提案する。
  • ポリシー・ネットワークの行動を、重要な状態における低次元埋め込みに変換する微分可能フィンガープリント機構を導入し、構造的依存関係を保持しながらサイズを最小限に抑える。
  • 自動微分を用いて、PVNから直接的にポリシー・パrameterに関する期待リターンの勾配を計算し、エンドツーエンドのポリシー勾配更新を可能にする。
  • PVNを逆伝播することで、環境とのインタラクションなしに実行されていない新しいポリシーの最適化が可能なゼロショットのポリシー勾配上昇を実現する。
  • 各ポリシーがフィンガープリントで表現され、全軌道ロールアウトにより評価された、事前に計算されたポリシー・リターンのペアのデータセットを用いてPVNを訓練する。
  • 多層型および線形ポリシー・ネットワークをサポートするようにフレームワークを拡張し、単純なアーキテクチャを超えたスケーラビリティと一般化性能を示した。

実験結果

リサーチクエスチョン

  • RQ1コンパクトで微分可能なポリシー埋め込みからのみ、ポリシー空間全体にわたって一般化し、期待リターンを正確に予測できるニューラルネットワークを学習可能か?
  • RQ2計算効率を保ちつつ、正確な価値予測に必要な十分な情報を保持するように、ポリシーを効果的にフィンガープリント化する方法は何か?
  • RQ3学習済みポリシーのすべてを上回る性能を達成するため、学習済みPVNを介した勾配上昇によって、環境との新たなインタラクションを必要とせずにポリシーを生成可能か?
  • RQ4従来のオンポリシーまたはオフポリシーRL手法と比較して、このアプローチはデータ効率性および最適化の安定性をどの程度向上できるか?

主な発見

  • 提案されたポリシーアイテーションネットワークは、ポリシースペース全体にわたって一般化に成功し、フィンガープリントに基づいて未学習のポリシーの期待リターンを正確に予測できる。
  • 微分可能フィンガープリント機構は、ポリシーの本質的特徴を効果的に捉えており、線形および多層型ポリシー・アーキテクチャの両方に対して一般化を可能にしている。
  • PVNを介したゼロショットのポリシー勾配上昇により、学習済みポリシーのすべてを上回る期待リターンを達成するポリシーが生成され、優れた一般化性能が実証された。
  • この手法により、ポリシー最適化中に即座に価値関数の更新が可能となり、従来のアクタ・クリティック手法で見られる遅延を解消することで、データ効率性の向上が期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。