Skip to main content
QUICK REVIEW

[論文レビュー] Learning Compositional Neural Programs with Recursive Tree Search and Planning

Thomas Pierrot, Guillaume Ligner|arXiv (Cornell University)|May 30, 2019
Reinforcement Learning in Robotics参考文献 38被引用数 13
ひとこと要約

この論文では、実行トレースを一切使用せず、プログラムの仕様と正誤テストのみを用いて、Neural Programmer-Interpreters (NPIs) を強化学習で学習するアルゴリズム、AlphaNPI を提案する。NPI に再帰的木探索と AlphaZero スタイルの計画を統合することで、ソートタスクにおいて優れた性能を発揮し、任意のハノイの塔パズルに一般化でき、強化学習による教師ありベースラインに匹敵する性能を達成する。

ABSTRACT

We propose a novel reinforcement learning algorithm, AlphaNPI, that incorporates the strengths of Neural Programmer-Interpreters (NPI) and AlphaZero. NPI contributes structural biases in the form of modularity, hierarchy and recursion, which are helpful to reduce sample complexity, improve generalization and increase interpretability. AlphaZero contributes powerful neural network guided search algorithms, which we augment with recursion. AlphaNPI only assumes a hierarchical program specification with sparse rewards: 1 when the program execution satisfies the specification, and 0 otherwise. Using this specification, AlphaNPI is able to train NPI models effectively with RL for the first time, completely eliminating the need for strong supervision in the form of execution traces. The experiments show that AlphaNPI can sort as well as previous strongly supervised NPI variants. The AlphaNPI agent is also trained on a Tower of Hanoi puzzle with two disks and is shown to generalize to puzzles with an arbitrary number of disk

研究の動機と目的

  • 従来の実行トレースを必要とするため、強化学習による Neural Programmer-Interpreters (NPIs) の学習において、強い教師信号の必要性を排除すること。
  • 実行トレースの代わりにプログラム仕様と正誤テストを用いることで、NPI の有効な強化学習訓練を可能にすること。
  • 階層的かつ再帰的なプログラム構造を活用して、強化学習エージェントにおける一般化性能と解釈可能性を向上させること。
  • モンテカルロ木探索 (MCTS) を用いた計画が、組み合わせ的タスクにおける単純なニューラル方策より顕著に性能を向上させることを示すこと。

提案手法

  • エンドツーエンドの強化学習学習を可能にするために、NPI をエージェント・クリティックネットワークに再定式化する。
  • 階層的かつ再帰的なプログラム構成を扱えるように、NPI フレームワークに再帰的木探索と AlphaZero スタイルの MCTS 計画を統合する。
  • スパarsな報酬信号を用いる:プログラム実行が仕様を満たしていれば 1、そうでなければ 0。
  • 温度制御スケジューラーを用いたカリキュラム学習を適用し、段階的にタスクの難易度を上げる。
  • ディリクレノイズと PUCT 基盤の探索を導入し、MCTS における活用と探索のバランスを取る。
  • 再帰的実行ペナルティ($r_{\text{pen-recur}}$)を適用し、訓練中に再帰的プログラムトレースの発見を促進する。

実験結果

リサーチクエスチョン

  • RQ1実行トレースが一切ない状況でも、NPI は強化学習で効果的に学習可能か?
  • RQ2正誤フィードバックとプログラム仕様のみを用いて、再帰的プログラム構造は RL で学習可能か?
  • RQ3直接方策学習と比較して、MCTS による計画が NPI 学習におけるサンプル効率と性能を顕著に向上させるか?
  • RQ4小さなインスタンスで観察された挙動に基づき、より大きな問題インスタンス(例:ハノイの塔のディスク数が増加)に一般化可能か?

主な発見

  • AlphaNPI は、スパarsな報酬と実行トレースなしの条件下でも、バブルソートタスクにおいて強教師あり NPI の変種と同等の性能を達成した。
  • エージェントは、小さなインスタンスからの誘導的推論を経て、任意のディスク数を持つハノイの塔パズルを正しく解けるように一般化した。
  • 推論時に MCTS 計画を用いたエージェントは、単純なニューラルネットワーク方策を上回る性能を示し、合成的プログラムにおけるサンプル効率の高い強化学習において計画の重要性を裏付けた。
  • 再帰的実行ペナルティは、再帰的プログラムトレースの発見を効果的に促進し、正しい再帰的解法の学習確率を高めた。
  • CPU 僅どの環境(12 コア、GPU 不要)でも、1環境あたり約 2 時間で学習が可能であり、中程度のハードウェアでも実現可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。