Skip to main content
QUICK REVIEW

[論文レビュー] Memory Augmented Policy Optimization for Program Synthesis with Generalization

Liang Chen, Mohammad Norouzi|arXiv (Cornell University)|Jul 6, 2018
Reinforcement Learning in Robotics参考文献 41被引用数 16
ひとこと要約

本論文は、高報酬軌道のメモリバッファを用いて分散を低減し、離散的アクションをとる決定論的環境におけるサンプル効率を向上させる、メモリ拡張型方策勾配法(MAPO)を提案する。MAPOは、弱教師ありの設定で、プログラム合成ベンチマークにおいて最先端の性能を達成し、WikiTableQuestionsでは46.2%、WikiSQLでは74.9%の精度を達成し、完全教師ありのベースラインを上回った。

ABSTRACT

This paper presents Memory Augmented Policy Optimization (MAPO): a novel policy optimization formulation that incorporates a memory buffer of promising trajectories to reduce the variance of policy gradient estimates for deterministic environments with discrete actions. The formulation expresses the expected return objective as a weighted sum of two terms: an expectation over a memory of trajectories with high rewards, and a separate expectation over the trajectories outside the memory. We propose 3 techniques to make an efficient training algorithm for MAPO: (1) distributed sampling from inside and outside memory with an actor-learner architecture; (2) a marginal likelihood constraint over the memory to accelerate training; (3) systematic exploration to discover high reward trajectories. MAPO improves the sample efficiency and robustness of policy gradient, especially on tasks with a sparse reward. We evaluate MAPO on weakly supervised program synthesis from natural language with an emphasis on generalization. On the WikiTableQuestions benchmark we improve the state-of-the-art by 2.5%, achieving an accuracy of 46.2%, and on the WikiSQL benchmark, MAPO achieves an accuracy of 74.9% with only weak supervision, outperforming several strong baselines with full supervision. Our code is open sourced at this https URL

研究の動機と目的

  • スパarsな報酬が与えられるプログラム合成タスクにおける方策勾配法のサンプル非効率性と高い分散の課題に対処すること。
  • 高報酬軌道の記憶を活用することで、弱教師ありプログラム合成における一般化性能を向上させること。
  • 離散的アクションをとる決定論的環境において、有望な軌道を効率的に探索・活用する訓練アルゴリズムを開発すること。
  • 高価な完全教師あり学習に依存せず、弱教師ありのみでプログラム合成ベンチマークで優れた性能を達成すること。
  • 記憶に基づく分散低減と体系的な探索を用いて、方策最適化のロバスト性と収束速度を向上させること。

提案手法

  • 高報酬軌道のメモリバッファ内の軌道と外の軌道における期待報酬を、重み付き和として定式化する。
  • エクスプロイト・ラーナー・アーキテクチャを用いて分散サンプリングを実装し、メモリバッファ内および外からの効率的サンプリングを実現する。
  • 高品質な軌道分布を保持することで、訓練の安定化と高速化を図るため、メモリにマージナル尤度制約を適用する。
  • 未だメモリにない高報酬軌道を能動的に発見できる体系的な探索戦略を統合する。
  • 分散低減と学習安定性の向上を図るため、記憶拡張型目的関数を組み込んだ決定論的方策勾配フレームワークを用いる。
  • 軌道の報酬に基づいて更新される動的メモリバッファを維持し、優れた性能を示すシーケンスを優先的に保持する。

実験結果

リサーチクエスチョン

  • RQ1記憶拡張型方策最適化は、報酬がスパarsなプログラム合成タスクにおいて分散を低減し、サンプル効率を向上させることができるか?
  • RQ2高報酬軌道の記憶を組み込むことで、弱教師ありプログラム合成における一般化性能にどのような影響を与えるか?
  • RQ3弱教師あり学習でのみ訓練された場合、MAPOは完全教師ありベースラインをどの程度上回ることができるか?
  • RQ4体系的な探索戦略は、報酬がスパarsな環境における高報酬軌道の発見にどのような影響を与えるか?
  • RQ5メモリバッファに適用されたマージナル尤度制約は、訓練の収束と安定性にどのような影響を与えるか?

主な発見

  • MAPOは、WikiTableQuestionsベンチマークで46.2%の最先端の精度を達成し、前回の最先端を2.5%上回った。
  • WikiSQLベンチマークでは、完全教師ありの強力なベースラインに比し、弱教師ありのみで74.9%の精度を達成した。
  • 記憶拡張型目的関数は、方策勾配の分散を顕著に低減し、報酬がスパarsな環境におけるより安定的かつ効率的な学習を可能にした。
  • 体系的な探索戦略により、特に初期学習段階において、高報酬軌道をより効果的に発見できるようになった。
  • メモリバッファに適用されたマージナル尤度制約は、性能に悪影響を与えることなく、収束を加速させ、サンプル効率を向上させた。
  • MAPOは強力な一般化能力を示し、プログラム合成タスクにおける未学習のテストインスタンスに対しても効果的に一般化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。