Skip to main content
QUICK REVIEW

[論文レビュー] Invariant Policy Optimization: Towards Stronger Generalization in Reinforcement Learning

Anoopkumar Sonar, Vincent Pacelli|arXiv (Cornell University)|Jun 1, 2020
Reinforcement Learning in Robotics参考文献 38被引用数 13
ひとこと要約

本稿では、観測値における因果構造を同定することで、訓練ドメインにわたって不変な方策を学習する強化学習アルゴリズムである不変方策最適化(IPO)を提案する。最適な行動予測器がドメイン間で一貫するような表現を学習することで、PPOなどの標準的方策勾配法と比較して、LQRタスク、色付きキーナビゲーション問題、物理的性質が異なるドア開閉タスクを含む未学習環境において、顕著に優れた一般化性能を達成する。

ABSTRACT

A fundamental challenge in reinforcement learning is to learn policies that generalize beyond the operating domains experienced during training. In this paper, we approach this challenge through the following invariance principle: an agent must find a representation such that there exists an action-predictor built on top of this representation that is simultaneously optimal across all training domains. Intuitively, the resulting invariant policy enhances generalization by finding causes of successful actions. We propose a novel learning algorithm, Invariant Policy Optimization (IPO), that implements this principle and learns an invariant policy during training. We compare our approach with standard policy gradient methods and demonstrate significant improvements in generalization performance on unseen domains for linear quadratic regulator and grid-world problems, and an example where a robot must learn to open doors with varying physical properties.

研究の動機と目的

  • 未学習の運用ドメインに方策を展開する際の強化学習における一般化性能の低さという課題に対処すること。
  • 因果構造の不変性を活用して分布シフトに強い方策を学ぶ手法を開発すること。
  • 訓練ドメインと運用ドメインが異なるロボット工学や自律システムなどの実世界の強化学習応用における一般化性能を向上させること。
  • 多様な訓練ドメインにわたる成功行動の原因を同定する不変性の原則を形式化し、実装すること。
  • 標準的方策勾配法(例:PPO)と比較して、未学習ドメインにおける優れた性能を示すこと。

提案手法

  • IPOは、最適な行動予測器がすべての訓練ドメインにわたって不変であるような表現を学ぶ問題として定式化する。
  • 共有表現ネットワークとドメイン不変な方策ヘッドを備えたアクトアクリティックアーキテクチャを採用する。
  • 訓練を安定化させるとともに、方策最適化中に不変性を強制するために、固定表現(Fixed-Φ)設定を用いる。
  • アルゴリズムは、すべてのドメインで同時に良好に動作する方策を最適化することで、非因果的で干渉する特徴(例:鍵の色)を無視するように暗黙的に学習する。
  • IPOは、標準的強化学習損失と不変表現学習を組み合わせて訓練され、不変リスク最小化(IRM)にインspiredされている。
  • 本手法は3つの環境で評価された:干渉観測が存在するLQR、色付きキーモデルのグリッドワールド、摩擦が異なるMuJoCoベースのドア開閉タスク。

実験結果

リサーチクエスチョン

  • RQ1環境の不変表現を学習することで、未学習ドメインへの一般化が可能な強化学習方策を訓練できるか?
  • RQ2訓練ドメインにわたって不変な方策を学習することは、分布外テスト環境での性能向上に寄与するか?
  • RQ3物理的性質の変化(例:ドアの摩擦)が生じる新しい状況において、IPOはPPOなどの標準的方策勾配法と比較してどのように一般化性能を発揮するか?
  • RQ4IPOは、PPOとは異なり、環境の変化にかかわらず不変な、強固な因果的戦略(例:適切なフック動作)を学習できるか?
  • RQ5不変表現学習は、ナビゲーションタスクにおける非因果的特徴(例:鍵の色)への過剰適合をどの程度軽減できるか?

主な発見

  • 干渉観測が存在するLQRタスクでは、IPOは未学習ドメインで平均98.5%の成功率を達成したのに対し、PPOは87.2%にとどまり、顕著な一般化性能の優位性を示した。
  • 色付きキーモデルのグリッドワールドでは、グレーの鍵を用いたテストドメインにおいてIPOは92.0%の成功率を達成したが、PPOは41.0%に低下した。
  • 訓練時よりも高い摩擦を有するドア開閉タスクでは、IPOは5つのシードで平均78.4%の成功率を達成したのに対し、PPOは平均32.0%にとどまった。
  • ドア開閉タスクにおいて、IPOは全5シードで一貫した強固なフック戦略を学習したが、PPOは3例でフックの外側に依存する一貫性のない行動を示した。
  • PPOの脆く文脈依存的な行動と比較して、IPOの一貫性があり因果的根拠を持つ行動という質的差が、IPOが不変かつ因果的根拠を持つ行動を学習できる能力を示している。
  • 結果から、IPOは3つのベンチマークタスクにおいて、定量的成績と定性的な頑健性の両面でPPOを顕著に上回っていることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。