Skip to main content
QUICK REVIEW

[論文レビュー] Towards Mixed Optimization for Reinforcement Learning with Program Synthesis

Surya Bhupatiraju, Kumar Krishna Agrawal|arXiv (Cornell University)|Jul 1, 2018
Reinforcement Learning in Robotics参考文献 13被引用数 3
ひとこと要約

本稿では、ブラックボックス方策から記号的プログラムを合成し、安全性および性能制約のために修復し、再びニューラル方策に戻して勾配ベース最適化を繰り返すことで、深層強化学習方策を段階的に改善する混合最適化フレームワーク、Morlを提案する。この手法により収束が速くなり、サンプル効率が向上し、CartPoleで微調整後の平均報酬が176.8に達したのに対し、変更なしの場合は38.65にとどまった。

ABSTRACT

Deep reinforcement learning has led to several recent breakthroughs, though the learned policies are often based on black-box neural networks. This makes them difficult to interpret and to impose desired specification constraints during learning. We present an iterative framework, MORL, for improving the learned policies using program synthesis. Concretely, we propose to use synthesis techniques to obtain a symbolic representation of the learned policy, which can then be debugged manually or automatically using program repair. After the repair step, we use behavior cloning to obtain the policy corresponding to the repaired program, which is then further improved using gradient descent. This process continues until the learned policy satisfies desired constraints. We instantiate MORL for the simple CartPole problem and show that the programmatic representation allows for high-level modifications that in turn lead to improved learning of the policies.

研究の動機と目的

  • ブラックボックス型の深層強化学習方策には、解釈が難しく、デバッグや安全保証付きの制約が困難であるという限界があるため、これを解決すること。
  • 訓練ループに記号的プログラム合成と修復を統合することで、高水準な変更を可能にする方策学習の改善。
  • 方策の精錬に記号的表現を活用することで、サンプル効率と収束速度の向上。
  • 再トレーニングの前に、人間または機械による支援を受けて記号的表現で方策を繰り返し修復できるフレームワークの提供。
  • 標準的な制御ベンチマーク、CartPole上でのこのアプローチの実現可能性と利点を実証すること。

提案手法

  • ドメイン固有言語(DSL)を用いて、トレーニング済みの深層RL方策から記号的プログラムを合成する。これはPirlおよびViperにインspiredされたものである。
  • 望ましい制約(例:安全性や行動改善)を満たすために、記号的プログラムの手動または自動的なプログラム修復を実施する。
  • 行動クラーニング(模倣学習)を用いて、修復済みの記号的プログラムを微分可能であるニューラル方策に蒸留する。
  • 勾配ベースの方策最適化(例:TRPO)を用いて、蒸留済み方策をさらに精錬する。
  • プロセスを繰り返す:方策 → プログラム → 修復済みプログラム → 蒸留済み方策 → 改善済み方策、という閉ループ精錬ループを形成する。
  • フレームワークの実装と有効性の検証のため、CartPole用のシンプルなDSLを用いる。

実験結果

リサーチクエスチョン

  • RQ1深層RL方策の記号的プログラム表現は、より効果的で解釈可能な方策改善を可能にするか?
  • RQ2記号的空間で方策を修復することは、その後の学習における収束速度とサンプル効率を向上させるか?
  • RQ3プログラム修復に埋め込まれた高水準な人間の知見は、初期化が悪い状況からでも方策性能を著しく向上させるか?
  • RQ4プログラム合成と修復の統合は、標準的なエンドツーエンドRLと比較して、収束速度と最終的性能において優れているか?
  • RQ5記号的表現は、強化学習における検証可能で安全な方策学習をどの程度サポートできるか?

主な発見

  • 最悪の初期化から始めた方策は25回の実験で平均報酬9.28を達成し、初期状態が悪いことによる性能の低さが示された。
  • プログラム修復と蒸留を経て得られた中間方策は、15,000エポックのトレーニング後に平均報酬66を達成し、顕著な改善が確認された。
  • ほぼ最適な修復済みプログラムは、15,000エポック後に平均報酬185を達成する蒸留済み方策を生み出し、記号的修復の有効性が裏付けられた。
  • TRPOを25エピソード分で微調整した結果、ほぼ最適なプログラムから導出された方策は平均報酬176.8を達成し、ベースラインを3倍以上上回った。
  • 修復済みの記号的方策から初期化されたTRPOトレーニングプロセスは、収束が著しく速くなったことから、記号的インサイトが学習を加速するという仮説が裏付けられた。
  • 繰り返し記号的空間での修復が、とくに初期化が悪い状況からでもほぼ最適な方策への収束を高速化できることを、フレームワークが成功裏に実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。