Skip to main content
QUICK REVIEW

[論文レビュー] Policy Improvement via Imitation of Multiple Oracles

Ching-An Cheng, Andrey Kolobov|arXiv (Cornell University)|Jul 1, 2020
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文は、複数の部分最適なオラクル方策から学習することで方策を改善する、新しい模倣学習アルゴリズムMAMBAを提案する。状態別にオラクル価値の最大値をロバストなベンチマークとして用い、一般化された利得推定(GAE)に基づく勾配推定器を採用することで、オラクルが弱いか、矛盾している場合でも、従来のIL手法を上回り、最良の単一オラクルをも凌駕する。

ABSTRACT

Despite its promise, reinforcement learning's real-world adoption has been hampered by the need for costly exploration to learn a good policy. Imitation learning (IL) mitigates this shortcoming by using an oracle policy during training as a bootstrap to accelerate the learning process. However, in many practical situations, the learner has access to multiple suboptimal oracles, which may provide conflicting advice in a state. The existing IL literature provides a limited treatment of such scenarios. Whereas in the single-oracle case, the return of the oracle's policy provides an obvious benchmark for the learner to compete against, neither such a benchmark nor principled ways of outperforming it are known for the multi-oracle setting. In this paper, we propose the state-wise maximum of the oracle policies' values as a natural baseline to resolve conflicting advice from multiple oracles. Using a reduction of policy optimization to online learning, we introduce a novel IL algorithm MAMBA, which can provably learn a policy competitive with this benchmark. In particular, MAMBA optimizes policies by using a gradient estimator in the style of generalized advantage estimation (GAE). Our theoretical analysis shows that this design makes MAMBA robust and enables it to outperform the oracle policies by a larger margin than the IL state of the art, even in the single-oracle case. In an evaluation against standard policy gradient with GAE and AggreVaTe(D), we showcase MAMBA's ability to leverage demonstrations both from a single and from multiple weak oracles, and significantly speed up policy optimization.

研究の動機と目的

  • 複数の部分最適なオラクルが利用可能な状況において、方策性能の原則的で一貫したベンチマークが欠如している問題に対処する。
  • 複数の矛盾するオラクルを統合し、より強力で統一されたベースライン方策を体系的に構築する手法を開発する。
  • 複数のオラクルの示範データを活用することで、すべての個別オラクルを実際に上回る性能を保証できる模倣学習アルゴリズムを設計する。
  • 特に弱いか多様なオラクルが存在する状況において、オラクルの品質や順序に頑健であることを保証する。
  • 複数オラクルによる模倣が、単一オラクルや標準的なRLベースラインと比較して、方策最適化の加速に顕著に寄与することを実証する。

提案手法

  • オラクル方策の価値の状態別最大値を自然で一貫して優れたベンチマークとして提案し、これを「最大集約ベースライン」と呼ぶ。
  • 理論的保証と効率的な学習を可能にするために、方策最適化をオンライン学習に還元する。
  • サンプル効率と方策性能の向上を図るため、一般化された利得推定(GAE)にインspiredされた勾配推定器を用いる。
  • 多段階の時系列的信用配分を重み付けるハイパーパrameter λ を導入し、関数近似誤差に対する頑健性を向上させる。
  • 各オラクル方策の価値関数近似器を学習し、それらを最大値集約によって統合してより強力なベースラインを形成する。
  • 方策の価値と最大集約ベースラインの差分を学習信号として用い、オンライン学習更新を方策に適用する。

実験結果

リサーチクエスチョン

  • RQ1複数の部分最適なオラクルが利用可能な状況において、原則的で普遍的に優れた方策性能ベンチマークとは何か?
  • RQ2複数のオラクルの示範データを統合することで、個々のオラクルをすべて上回る方策を体系的に改善できるか?
  • RQ3複数オラクルによる模倣は、強化学習におけるサンプル効率と収束速度にどのように影響するか?
  • RQ4λ(時系列的信用配分重み)の選択が、頑健性と性能向上に果たす役割は何か?
  • RQ5オラクル品質が低い場合やオラクルの順序がランダムな場合、アルゴリズムはどのように動作するか?また、このような状況下でも単一オラクルベースラインを上回れるか?

主な発見

  • MAMBAは、すべての環境でAggreVaTe(D) や PG-GAE を一貫して上回り、特にオラクルが弱いか部分最適な場合に顕著である。
  • λ > 0 の場合、MAMBAは後から最良のオラクルを使用するAggreVaTe(D) でさえも上回る性能を達成する。
  • 複数のオラクルを用いることで性能が著しく向上し、特にλが大きい場合、より良いベースライン価値推定が可能になるためである。
  • ランダムなオラクル順序下でもアルゴリズムは頑健であり、複数のオラクルを用いたMAMBAはAggreVaTe(D) や PG-GAE を上回る。
  • DoubleInvertedPendulum などの高次元環境では、λ重み付けが関数近似誤差への依存を軽減し、学習の安定性を向上させる。
  • あまりに多くの弱いオラクルを含めると、各オラクルあたりのサンプル複雑度が増加するため性能が低下するが、オラクルが適切に選択されていれば多様性の利点がそのコストを上回る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。