Skip to main content
QUICK REVIEW

[論文レビュー] PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning

Jianxiong Li, Xiao Hu|arXiv (Cornell University)|May 25, 2023
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

PROTOは、進化する方策に基づく動的正則化を用いて、固定された方策制約を置き換える反復的方策正則化フレームワークを提案する。この手法により、信頼領域スタイルの更新を通じて段階的に保守性を緩和することで、オンライン微調整の安定性が向上する。固定された方策制約の代わりに最新の方策に基づく動的正則化を採用することで、最小限の計算コストと高い多様な事前学習および微調整手法への適応性を実現しながら、最先端の性能を達成する。

ABSTRACT

Offline-to-online reinforcement learning (RL), by combining the benefits of offline pretraining and online finetuning, promises enhanced sample efficiency and policy performance. However, existing methods, effective as they are, suffer from suboptimal performance, limited adaptability, and unsatisfactory computational efficiency. We propose a novel framework, PROTO, which overcomes the aforementioned limitations by augmenting the standard RL objective with an iteratively evolving regularization term. Performing a trust-region-style update, PROTO yields stable initial finetuning and optimal final performance by gradually evolving the regularization term to relax the constraint strength. By adjusting only a few lines of code, PROTO can bridge any offline policy pretraining and standard off-policy RL finetuning to form a powerful offline-to-online RL pathway, birthing great adaptability to diverse methods. Simple yet elegant, PROTO imposes minimal additional computation and enables highly efficient online finetuning. Extensive experiments demonstrate that PROTO achieves superior performance over SOTA baselines, offering an adaptable and efficient offline-to-online RL framework.

研究の動機と目的

  • 分布シフトと過度な保守性による初期性能低下と最適でない方策性能を解消すること。
  • 固定された制約や特定の事前学習フレームワークに依存する既存手法の限界的な適応性を克服すること。
  • アンサンブルモデルや複雑な保守的訓練方式を避けることで、計算効率を向上させること。
  • 最小限のコード変更で多様なオフライン事前学習およびオンポリシー/オフポリシー微調整手法へのシームレスな統合を可能にすること。
  • 持続的な保守性によって引き起こされる非最適性を導入せずに、最良の最終性能を達成すること。

提案手法

  • 事前学習方策 $\pi_0$ の代わりに、最新に更新された方策 $\pi_k$ に近づくように微調整方策を制約する反復的方策正則化項を導入する。
  • 方策 $\pi_{k+1}$ と $\pi_k$ の二乗差に基づく正則化損失を最小化することで、信頼領域スタイルの更新を実行し、安定した方策更新を確保する。
  • 反復回数に応じて線形に冷却される正則化強度 $\alpha$ を用いて、段階的に保守性を緩和し、後段階での過度な保守性を回避する。
  • SACおよびTD3ベースの微調整に正則化項を適用し、決定性方策のMSEベース正則化損失を目的関数に統合する。
  • TD3ではQ値損失と正則化損失のバランスをとるためにスケーリング係数 $\lambda$ を用い、ハイパーパrameterの爆発を防ぎながら安定な学習を実現する。
  • 標準的なオフポリシーRLアルゴリズムへのプラグアンドプレイ統合を可能にし、わずかなコード変更で計算効率を保持する。

実験結果

リサーチクエスチョン

  • RQ1進化する方策に基づく反復的正則化は、オフラインからオンラインRLにおける初期微調整の安定性と最終性能を向上させることができるか?
  • RQ2固定された方策制約を動的正則化に置き換えることで、非最適性を低減しながら分布シフトに対してロバスト性を維持できるか?
  • RQ3PROTOは、アーキテクチャの変更を最小限に抑えつつ、多様な事前学習手法(例:BC, CQL)および微調整アルゴリズム(例:SAC, TD3)でSOTA性能を達成できるか?
  • RQ4実際の運用において、PROTOの計算コストはアンサンブルベースや保守的RL手法と比べてどの程度か?
  • RQ5反復的正則化は、固定正則化に比べて、サンプル効率および最終性能の面でどの程度優れているか?

主な発見

  • PROTOはD4RLベンチマークにおいて複数の環境で最先端の性能を達成し、既存のSOTAベースラインを上回った。
  • PROTOは、単純な行動コーディング(BC)方策から始めても安定したオンライン微調整を可能にし、複雑なオフライン事前学習の必要性を排除した。
  • 実験では、計算効率が高く、SAC や TD3 などの標準的なオフポリシーRLアルゴリズムと比較して、ほとんど無視できるほどの追加コストしか発生しなかった。
  • 実験結果から、固定方策正則化(例:Frozen)は持続的な過度な保守性により深刻な性能停滞を示す一方、PROTOの反復的アプローチはこの問題を回避した。
  • PROTO+TD3は16のタスクで競争力ある性能を達成し、わずかな修正で異なるオンラインRLアルゴリズムに広く適応可能であることを示した。
  • アブレーションスタディの結果、反復的正則化は固定正則化に比べて学習速度が速く、最終的な性能も優れており、線形に冷却される保守性でさえも有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。