Skip to main content
QUICK REVIEW

[論文レビュー] Batch Policy Learning under Constraints

Hoai Minh Le, Cameron Voloshin|arXiv (Cornell University)|Mar 20, 2019
Reinforcement Learning in Robotics参考文献 59被引用数 12
ひとこと要約

本論文は、複数の制約下でのバッチ方策学習のための新しいメタアルゴリズムを提案する。学習還元を用いてオンライン学習および教師あり学習に還元する。PACスタイルの境界を備えた新しいオフポリシー評価手法を導入し、理論的制約満たしと高次元制御タスク(安全性および滑らかさの制約を伴う模擬的自動車走行など)における強力な実験的性能を達成する。

ABSTRACT

When learning policies for real-world domains, two important questions arise: (i) how to efficiently use pre-collected off-policy, non-optimal behavior data; and (ii) how to mediate among different competing objectives and constraints. We thus study the problem of batch policy learning under multiple constraints, and offer a systematic solution. We first propose a flexible meta-algorithm that admits any batch reinforcement learning and online learning procedure as subroutines. We then present a specific algorithmic instantiation and provide performance guarantees for the main objective and all constraints. To certify constraint satisfaction, we propose a new and simple method for off-policy policy evaluation (OPE) and derive PAC-style bounds. Our algorithm achieves strong empirical results in different domains, including in a challenging problem of simulated car driving subject to multiple constraints such as lane keeping and smooth driving. We also show experimentally that our OPE method outperforms other popular OPE techniques on a standalone basis, especially in a high-dimensional setting.

研究の動機と目的

  • 実世界の順序的意思決定タスクにおいて、事前に収集された非最適なオフポリシーデータから効果的な方策を学習する課題に対処すること。
  • 自動運転における移動時間の最小化と安全性・快適性の確保といった、対立する目的や制約の間で調整すること。
  • バッチ学習設定において、主な目的と制約満たしの両方に対する理論的保証を提供すること。
  • 制約準拠の検証に適したPACスタイルの境界を備えた、新しい単純なオフポリシー評価技術を開発すること。
  • ナビゲーションおよび複数の制約を伴う高次元の自動車レースタスクにおいて、手法の実験的妥当性を検証すること。

提案手法

  • フレームワークは、制約付きバッチ方策学習問題を、バッチ強化学習およびオンライン学習のサブルーチンに還元するメタアルゴリズムを用いる。
  • 多段階の学習還元を採用し、制約付き問題を性能保証付きの教師あり学習およびオンライン学習タスクの系列に変換する。
  • 重要度サンプリングに基づき、新規の補正機構を備えた新しいオフポリシー評価手法を提案し、信頼性の高い制約検証を可能にする。
  • 高次元設定における価値関数および方策関数推定に、関数近似として深層ニューラルネットワーク(例:CNN)を用いる。
  • 混合方策の最適化に、ハイパーパrameter $ B=10 $, $ \eta = 0.01 $ を用いたExponentiated Gradientアルゴリズムをサブルーチンとして使用する。
  • 複数の基本方策からなる混合方策を構築することで、制約の堅牢な満たしを実現するとともに、主な目的の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1非最適なオフポリシーデータから、理論的保証付きで複数の制約を満たす方策を学習可能か?
  • RQ2オンライン相互作用なしで、順序的意思決定における制約満たしをどのように検証できるか?
  • RQ3学習還元と新規のOPE技術を用いることで、バッチ強化学習におけるサンプル効率と制約準拠の適合性を向上できるか?
  • RQ4高次元的かつ長時間スパンの環境において、提案されたOPE手法は既存手法と比較してどのように差をつけるか?
  • RQ5本フレームワークは、自動運転における速度、安全性、滑らかさといった対立する目的をどの程度バランスさせられるか?

主な発見

  • 提案されたオフポリシー評価手法は、特に高次元設定において、安定性の向上と分散の低減により、既存手法を上回る性能を示した。
  • 模擬的自動車レース環境において、アルゴリズムは、車線維持制約および滑らか運転制約の両方を強く満たした。
  • 理論的分析により、非線形関数近似におけるサンプル複雑度の境界を $ O(n^4) $ から $ O(n^2) $ に改善し、データ効率を向上させた。
  • 自動車レース実験では、グリッドサーチから得た正則化された方策の約10%しか両方の制約を満たさなかったが、本手法は一貫した制約満たしを達成した。
  • 混合方策アプローチにより、混合内の個々の方策が一貫して制約を満たし、かつデータ生成方策よりも主な目的で優れた性能を示した。
  • モデルベースのOPE手法(例:Doubly RobustおよびWeighted Doubly Robust)は、高次元的かつ長時間スパンのドメインにおける動的モデルの不正確さのため失敗した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。