Skip to main content
QUICK REVIEW

[論文レビュー] Supported Policy Optimization for Offline Reinforcement Learning

Jialong Wu, Haixu Wu|arXiv (Cornell University)|Feb 13, 2022
Reinforcement Learning in Robotics被引用数 11
ひとこと要約

本論文は、オフライン強化学習におけるプラグイン型正則化手法であるサポートドポリシーオプティマイゼーション(SPOT)を提案する。SPOTは、VAEベースの推定器を用いて行動方策の密度を明示的にモデル化し、サポート制約を強制する。SPOTはD4RLベンチマークで最先端の性能を達成し、標準的なオフポリシー学習アルゴリズムとの互換性を保ったまま、強力なオンラインファインチューニングを可能にする。

ABSTRACT

Policy constraint methods to offline reinforcement learning (RL) typically utilize parameterization or regularization that constrains the policy to perform actions within the support set of the behavior policy. The elaborative designs of parameterization methods usually intrude into the policy networks, which may bring extra inference cost and cannot take full advantage of well-established online methods. Regularization methods reduce the divergence between the learned policy and the behavior policy, which may mismatch the inherent density-based definition of support set thereby failing to avoid the out-of-distribution actions effectively. This paper presents Supported Policy OpTimization (SPOT), which is directly derived from the theoretical formalization of the density-based support constraint. SPOT adopts a VAE-based density estimator to explicitly model the support set of behavior policy and presents a simple but effective density-based regularization term, which can be plugged non-intrusively into off-the-shelf off-policy RL algorithms. SPOT achieves the state-of-the-art performance on standard benchmarks for offline RL. Benefiting from the pluggable design, offline pretrained models from SPOT can also be applied to perform online fine-tuning seamlessly.

研究の動機と目的

  • 既存のポリシー制約手法の限界、特に推論効率と分布外行動の効果的回避の間のトレードオフを解決すること。
  • 理論的密度ベースのサポート制約を直接強制する、侵襲的でない、プラグイン可能な正則化技術の開発。
  • well-establishedなオンラインRLアルゴリズムを用いて、高性能なオフライン事前学習の後、シームレスなオンラインファインチューニングを可能にすること。
  • 分布外行動を効果的に制約できない、侵襲的なアーキテクチャ変更や不一致なダイバージェンスベース正則化に依存するのを減らすこと。

提案手法

  • サポート集合の理論的定式化に基づく密度ベース正則化項を導入し、ポリシーが行動方策のサポート内に制限されるように直接制約する。
  • 行動方策の密度を明示的にモデル化できるように、変分オートエンコーダ(VAE)ベースの密度推定器を採用し、オフラインデータから正確なサポート集合推定を可能にする。
  • 標準的なオフポリシーRLアルゴリズム(例:TD3)に、侵襲的でない、プラグイン可能な形で正則化項を統合し、推論時に1回の順伝播のみを要する。
  • 学習可能な正則化重みを用いてポリシー最適化目的関数と密度制約のバランスを調整し、オンラインファインチューニング中にスケジュールに従って減少させる。
  • オフラインとオンライン学習目的関数のギャップを最小限に抑え、標準的なオンラインRL目的関数との互換性を確保することで、オンライン適応への効果的な転送を実現する。
  • トレーニング中にVAEベースの密度推定器を活用し、正則化損失を計算する。この損失は、推定された行動方策密度が低い行動に対してペナルティを与える。

実験結果

リサーチクエスチョン

  • RQ1侵襲的でない密度ベース正則化手法は、既存のパrameterizationベースおよびダイバージェンスベース正則化手法を上回ることができるか?
  • RQ2VAEベースの密度推定器を用いて行動方策のサポート集合を明示的にモデル化することで、挑戦的なオフラインRLベンチマークでより優れた一般化性とロバスト性が得られるか?
  • RQ3SPOTは標準的なD4RLオフラインRLベンチマークで最先端の性能を達成できるか、かつ効果的なオンラインファインチューニングを可能にするか?
  • RQ4既存のparameterizationベースおよび正則化ベース手法と比較して、SPOTの推論効率とトレーニングオーバーヘッドはどの程度か?
  • RQ5正則化重みの選択が性能にどの程度影響を与えるか、また、広範なオンライン評価を伴わずに選択可能か?

主な発見

  • SPOTはD4RLオフラインRLベンチマークで最先端の性能を達成し、MuJoCoおよびAntMaze環境においてIQLやTD3+BCといった強力なベースラインを上回る。
  • AntMaze環境では、大規模な迷路において最終報酬が90.8を記録し、最も強いベースラインであるIQL(73.4)を大きく上回り、初期からオンライン学習を実施した場合をも上回る。
  • SPOTはオフライン事前学習後にシームレスなオンラインファインチューニングを可能にし、AntMazeの大規模迷路では初期のオフライン性能から17.4ポイントの向上を達成した。
  • SPOTの推論は計算的に効率的で、ポリシーネットワークの順伝播を1回のみ必要とし、BCQの2倍以上速く、TD3+BCと同等の速度である。
  • SPOTのトレーニング時間はTD3+BCとほとんど同等であり、BCQのようなparameterizationベース手法よりも顕著に短く、性能と効率の良好なトレードオフを示している。
  • アブレーションスタディにより、密度ベース正則化がダイバージェンスベース正則化よりも分布外行動の回避に有効であることが確認され、SPOTの理論的基盤の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。