Skip to main content
QUICK REVIEW

[論文レビュー] Imitation-Projected Programmatic Reinforcement Learning

Abhinav Verma, Hoang M. Le|arXiv (Cornell University)|Jul 11, 2019
Reinforcement Learning in Robotics参考文献 55被引用数 8
ひとこと要約

本稿では、ミラー降下とインスパイラショントベースのプログラム合成を組み合わせることで、解釈可能で一般化可能なポリシーとしての記号的プログラムを学習する、プログラム的強化学習のための新規メタアルゴリズムである Propel を提案する。インスパイラショント学習を用いて制約のない深層ポリシー勾配をプログラム的ポリシー空間に射影することで、 Propel は連続制御タスクにおいて最先端の性能を達成し、特に Torcs の自動車レース環境において、サンプル効率とロバストネスの面で顕著な向上を示した。

ABSTRACT

We study the problem of programmatic reinforcement learning, in which policies are represented as short programs in a symbolic language. Programmatic policies can be more interpretable, generalizable, and amenable to formal verification than neural policies; however, designing rigorous learning approaches for such policies remains a challenge. Our approach to this challenge -- a meta-algorithm called PROPEL -- is based on three insights. First, we view our learning task as optimization in policy space, modulo the constraint that the desired policy has a programmatic representation, and solve this optimization problem using a form of mirror descent that takes a gradient step into the unconstrained policy space and then projects back onto the constrained space. Second, we view the unconstrained policy space as mixing neural and programmatic representations, which enables employing state-of-the-art deep policy gradient approaches. Third, we cast the projection step as program synthesis via imitation learning, and exploit contemporary combinatorial methods for this task. We present theoretical convergence results for PROPEL and empirically evaluate the approach in three continuous control domains. The experiments show that PROPEL can significantly outperform state-of-the-art approaches for learning programmatic policies.

研究の動機と目的

  • 連続制御環境における解釈可能で検証可能かつ一般化可能なポリシーの学習という課題に取り組む。
  • 大規模な蒸留ギャップと最適でないポリシー探索という、既存のプログラム的強化学習手法の限界を克服する。
  • 深層ポリシー勾配と記号的プログラム合成を統合した、制約付きポリシー最適化のための統一フレームワークを構築する。
  • インスパイラショント学習と組み合わせた合成技術に裏付けられた射影機構を通じて、効果的なプログラム的ポリシーの学習を可能にする。
  • 近似勾配と射影を伴う場合の収束性および有限サンプル性能に対する理論的保証を提供する。

提案手法

  • ポリシー空間における制約付き最適化問題としてプログラム的ポリシー学習を定式化し、ポリシーが事前に定義された記号的プログラムクラスに属する必要があることを規定する。
  • 神経的およびプログラム的表現を組み合わせた非制約ポリシー空間における勾配ステップをミラー降下を用いて実行する。
  • 射影をインスパイラショント学習問題として扱い、非制約ポリシーをプログラム的ポリシー空間へと射影する。
  • 行動の模倣による行動デモンストレーションからの効率的なプログラム合成のため、現代的な組合せ的および記号的手法を活用する。
  • 混合表現空間における非制約勾配の計算に、最先端の深層ポリシー勾配法(例:DDPG、TRPO)を統合する。
  • 近似勾配と射影を伴う場合のレグレットと収束性を理論的分析により限定し、有限サンプル性能の保証を確保する。

実験結果

リサーチクエスチョン

  • RQ1深層ポリシー勾配と記号的プログラム合成を統合することで、効果的にプログラム的ポリシーを学習できるメタアルゴリズムを設計できるか?
  • RQ2非制約空間からプログラム的ポリシー空間への射影ステップを、理論的根拠が強いインスパイラショント学習問題としてどのように定式化できるか?
  • RQ3近似勾配と射影を伴う場合、提案手法の理論的収束特性はどのようなものか?
  • RQ4既存のプログラム的強化学習手法と比較して、本手法はどの程度サンプル効率、一般化、ロバストネスを向上させるか?
  • RQ5本手法は、記号的技術による検証が可能な形式的性質(例:行動の滑らかさ)を満たすポリシーを学習できるか?

主な発見

  • Propel は、Torcs 環境の E-Road トラックにおいて、中央値ラップタイム 78.47 秒、クラッシュ率 0.16 を達成し、最先端の手法を上回った。
  • Torcs の挑戦的タスクである Alpine-2 トラックでは、PropelTree が中央値ラップタイム 276 秒、クラッシュ率 0.92 を達成し、半数以上のシードでクラッシュする既存手法を著しく上回った。
  • MountainCar 環境では、PropelProg が 95.63 ± 1.02 のスコアを達成し、DDPG(97.16 ± 3.21)や他のベースラインを上回り、より優れたサンプル効率と安定性を示した。
  • Pendulum 環境では、PropelTree が -139.09 ± 3.31 のリターンを達成し、DDPG(-132.70 ± 6.44)および Viper(-394.11 ± 4.97)を上回り、より優れたポリシー品質とロバストネスを示した。
  • 学習済みプログラムにおいて、RPM の変化が 6 ステップにわたり小さい場合、加速度の変化が 0.63 以内に制限されることを確認し、形式的検証可能性を裏付けた。
  • 一般化の結果、PropelTree は DDPG や PropelProg よりも優れた一般化性能を示し、G-Track や E-Road といった未学習のトラックでも中央値ラップタイムが 100 秒未満に収まった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。