Skip to main content
QUICK REVIEW

[論文レビュー] Program Synthesis Guided Reinforcement Learning

Yichen Yang, Jeevana Priya Inala|arXiv (Cornell University)|Feb 22, 2021
Reinforcement Learning in Robotics参考文献 54被引用数 4
ひとこと要約

本論文では、部分観測性を未観測の世界状態の不確実性をモデル化することで扱う、モデル予測プログラム合成を用いたプログラム合成誘導型強化学習手法を提案する。この手法は、2D Minecraft風のクラフトワールドやMuJoCo Antの変種といった困難な環境において、完全なプログラム知識を持つオラクルと同等の性能を達成する。

ABSTRACT

A key challenge for reinforcement learning is solving long-horizon planning and control problems. Recent work has proposed leveraging programs to help guide the learning algorithm in these settings. However, these approaches impose a high manual burden on the user since they must provide a guiding program for every new task they seek to achieve. We propose an approach that leverages program synthesis to automatically generate the guiding program. A key challenge is how to handle partially observable environments. We propose model predictive program synthesis, which trains a generative model to predict the unobserved portions of the world, and then synthesizes a program based on samples from this model in a way that is robust to its uncertainty. We evaluate our approach on a set of challenging benchmarks, including a 2D Minecraft-inspired ``craft'' environment where the agent must perform a complex sequence of subtasks to achieve its goal, a box-world environment that requires abstract reasoning, and a variant of the craft environment where the agent is a MuJoCo Ant. Our approach significantly outperforms several baselines, and performs essentially as well as an oracle that is given an effective program.

研究の動機と目的

  • 長時間計画タスクにおける強化学習のためのガイドプログラムの手動提供の負担を軽減すること。
  • 状態情報が不完全な複雑な環境における部分観測性の課題に対処すること。
  • 未観測の世界状態における不確実性をモデル化することで、頑健なプログラムを合成する手法を開発すること。
  • 複雑なサブタスクの順序付けと抽象的推論を要する環境において、このアプローチを評価すること。
  • 最適なガイドプログラムにアクセスできるオラクルの性能に近い性能を示すことを実証すること。

提案手法

  • 本手法はモデル予測プログラム合成を用い、未観測の環境状態の部分を予測する生成モデルを訓練する。
  • 生成モデルからサンプリングすることで、予測状態における不確実性に耐性を持つプログラムを合成する。
  • 合成されたプログラムをインダクティブバイアスとして用いることで、探索と方策学習をガイドする。
  • 状態予測における不確実性を考慮する計画メカニズムを採用し、部分観測設定における一般化性能を向上させる。
  • 生成モデルとプログラム合成器を共同で最適化することで、タスクパフォーマンスを向上させるエンドツーエンドのフレームワークを訓練する。
  • プログラム生成と方策学習をガイドするために、模倣学習と強化学習の信号の組み合わせを用いる。

実験結果

リサーチクエスチョン

  • RQ1手動指定なしに、プログラム合成を用いて強化学習のためのガイドプログラムを自動的に生成できるか?
  • RQ2部分観測環境における不確実性を、プログラム合成の過程で効果的にモデル化し、活用できるか?
  • RQ3自動的に合成されたプログラムが、オラクルが提供する最適なプログラムとどの程度同等の性能を達成できるか?
  • RQ4観測の疎らさやタスクの複雑さの異なる環境において、この手法はどの程度スケーリング可能か?
  • RQ5不確実性を考慮したプログラム合成が、長時間タスクの成功確率にどのような影響を与えるか?

主な発見

  • 2D Minecraft風クラフト環境において、複数の強力なベースラインを著しく上回り、高いサンプル効率とタスク成功確率を達成した。
  • 抽象的推論を要するボックスワールド環境において、本手法は頑健な性能を示し、複雑で多段階の推論タスクを効果的に処理できることを示した。
  • クラフト環境のMuJoCo Antバージョンにおいて、最適なガイドプログラムを備えたオラクルとほぼ同等のパフォーマンスを達成した。
  • モデル予測プログラム合成部は、状態の不確実性の影響を効果的に低減し、部分観測設定におけるより信頼性の高い方策学習を実現した。
  • 多様な環境にわたる一般化性能が強く、テストされたベンチマークを越えてスケーラブルであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。