Skip to main content
QUICK REVIEW

[論文レビュー] Policy Expansion for Bridging Offline-to-Online Reinforcement Learning

Haichao Zhang, Xu We|arXiv (Cornell University)|Feb 2, 2023
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、オンライン微調整中に事前学習済みのオフラインポリシーをポリシー集合に維持し、新たなポリシーを導入することで、オフラインからオンライン強化学習を向上させる手法であるポリシー拡張(PEX)を提案する。相互作用中に二つのポリシーが適応的に組み合わされ、オフライン知識を保持するとともに補完的探索を可能にし、ベンチマークタスク全体でサンプル効率とパフォーマンスが向上する。

ABSTRACT

Pre-training with offline data and online fine-tuning using reinforcement learning is a promising strategy for learning control policies by leveraging the best of both worlds in terms of sample efficiency and performance. One natural approach is to initialize the policy for online learning with the one trained offline. In this work, we introduce a policy expansion scheme for this task. After learning the offline policy, we use it as one candidate policy in a policy set. We then expand the policy set with another policy which will be responsible for further learning. The two policies will be composed in an adaptive manner for interacting with the environment. With this approach, the policy previously learned offline is fully retained during online learning, thus mitigating the potential issues such as destroying the useful behaviors of the offline policy in the initial stage of online learning while allowing the offline policy participate in the exploration naturally in an adaptive manner. Moreover, new useful behaviors can potentially be captured by the newly added policy through learning. Experiments are conducted on a number of tasks and the results demonstrate the effectiveness of the proposed approach. Code is available at https://github.com/Haichao-Zhang/PEX

研究の動機と目的

  • オンライン強化学習における事前学習済みオフラインポリシーの微調整時に生じる深刻な忘却と分布シフトの課題に対処すること。
  • オンライン学習中に上書きされないよう、オフラインポリシーがオンライン探索に能動的に参加できるようにすること。
  • 既存のオフラインおよびオンライン強化学習アルゴリズムと組み合わせられる、シンプルでモジュラーなフレームワークを開発すること。
  • 事前学習済み行動を活用しつつ、新しい行動が出現できるようにすることで、オンライン強化学習におけるサンプル効率と最終パフォーマンスを向上させること。
  • 新しい統合型オフライン・オンライン強化学習アルゴリズムの開発とは直交する代替手法を提供すること。

提案手法

  • 本手法は、事前学習済みオフラインポリシー $\pi_\beta$ と新たに初期化されたポリシー $\pi_\theta$ を含むポリシー集合を維持する。
  • オンライン相互作用中、最終的な行動は、ルーティングネットワークによって制御される学習可能な適応的組み合わせにより $\pi_\beta$ と $\pi_\theta$ から選択される。
  • ルーティングネットワークは、現在の状態に基づいて各ポリシーの選択確率を決定し、動的なポリシー切り替えを可能にする。
  • オンライン学習中、オフラインポリシー $\pi_\beta$ は固定され、学習プロセス全体でその行動が保持される。
  • 新しいポリシー $\pi_\theta$ は、標準的なオフポリシー強化学習アルゴリズム(例:SAC)を用いてオンラインで訓練され、新しい行動を学習できる。
  • 本手法は、既存のオフライン(例:IQL)およびオンライン(例:SAC)強化学習手法と互換性があり、プラグアンドプレイ統合が可能である。

実験結果

リサーチクエスチョン

  • RQ1オンライン微調整中にオフラインポリシーを保持することで、深刻な忘却によるパフォーマンス低下を防げるか?
  • RQ2オフラインおよびオンラインポリシーの適応的組み合わせが、オンライン強化学習における探索とサンプル効率を向上させるか?
  • RQ3提案されたポリシー拡張方式は、単一ポリシーによる標準的微調整よりも、オフラインからオンライン強化学習の設定で優れた性能を示すか?
  • RQ4ポリシー集合内の二つのポリシーは、状態空間全体でどのように使用されているか?また、それらは補完的行動を示しているか?
  • RQ5本手法は、アルゴリズムの再設計を要せず、異なるオフラインおよびオンライン強化学習アルゴリズムと効果的に組み合わせられるか?

主な発見

  • 提案されたPEX手法は、AntMazeやHalfCheetahを含む複数のベンチマークタスクで一貫したパフォーマンス向上を達成した。
  • AntMaze-medium-diverse環境では、PEXは標準的微調整および他のベースラインを上回り、より高い最終リターンと高速な収束を達成した。
  • 可視化結果から、オフラインポリシー $\pi_\beta$ は主に安全で既知の領域で使用されており、$\pi_\theta$ は新規かつ挑戦的な状態を探索していた。
  • 適応的組み合わせメカニズムにより、ポリシー集合は動的に行動を切り替えられ、$\pi_\theta$ が高不確実性または未探索領域で主導的役割を果たした。
  • 本手法は、さまざまなオフライン事前学習アルゴリズムおよびオンライン強化学習手法に対してロバストであり、汎用性の高さを確認した。
  • 本手法は、オンライン学習中でもオフラインポリシーのパフォーマンスを維持しており、標準的微調整で観察されるパフォーマンス低下を回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。