[論文レビュー] Discovered Policy Optimisation
本稿では、ミラー学習フレームワーク内でのメタラーニングを用いて発見された、新しい深層強化学習アルゴリズムであるDPO(Discovered Policy Optimisation)を紹介する。進化戦略を用いてニューラルネットワークのドリフト関数をメタ最適化することで、まずLearnt Policy Optimisation(LPO)を学習し、その後その行動的洞察(慎重な楽観主義とロールバック)を閉形式で理論的に整合性のあるアルゴリズムDPOに蒸留する。DPOはLPOと同等の性能を達成し、ハイパーパrameterチューニングなしでBrax環境においてPPOを上回る性能を示す。
Tremendous progress has been made in reinforcement learning (RL) over the past decade. Most of these advancements came through the continual development of new algorithms, which were designed using a combination of mathematical derivations, intuitions, and experimentation. Such an approach of creating algorithms manually is limited by human understanding and ingenuity. In contrast, meta-learning provides a toolkit for automatic machine learning method optimisation, potentially addressing this flaw. However, black-box approaches which attempt to discover RL algorithms with minimal prior structure have thus far not outperformed existing hand-crafted algorithms. Mirror Learning, which includes RL algorithms, such as PPO, offers a potential middle-ground starting point: while every method in this framework comes with theoretical guarantees, components that differentiate them are subject to design. In this paper we explore the Mirror Learning space by meta-learning a "drift" function. We refer to the immediate result as Learnt Policy Optimisation (LPO). By analysing LPO we gain original insights into policy optimisation which we use to formulate a novel, closed-form RL algorithm, Discovered Policy Optimisation (DPO). Our experiments in Brax environments confirm state-of-the-art performance of LPO and DPO, as well as their transfer to unseen settings.
研究の動機と目的
- ハイパーパrameter感受性やロバストネスの欠如といった、手作業で設計されたRLアルゴリズムの限界を克服するため、アルゴリズム発見の自動化を目的とする。
- 収束性と安定性を保証する理論的根拠に基づいたフレームワーク、特にミラー学習におけるアルゴリズム発見を探索する。
- ドリフト関数のメタラーニングを通じて、人間の直感に依存せずに、高性能で汎用性の高いRLアルゴリズムを発見する。
- 学習されたニューラルネットワークベースのドリフト関数から得られる知見を、実用的導入を想定したシンプルな閉形式アルゴリズムに蒸留する。
提案手法
- 進化戦略(ES)を用いて、ミラー学習フレームワークにおけるドリフト関数のニューラルネットワークパラメータ化をメタラーニングする。
- 複数のシードで性能を最適化する目的で、Brax環境のサブセット(特にAnt)でドリフト関数を訓練する。
- 学習されたLPOドリフト関数を分析し、高報酬行動に対する慎重な楽観主義や低報酬行動に対するロールバックといった、重要なアルゴリズム的行動を同定する。
- ReLUおよびtanh活性化関数を用いて、LPOの主要な行動を再現する閉形式でパラメータフリーのドリフト関数を導出する——これが、DPO(Discovered Policy Optimisation)である。
- 報酬の利得の符号と行動報酬履歴に依存する、2行の解析的更新ルールとしてDPOを実装する。
- LPOおよびDPOを、学習時とは異なるBrax環境およびMinatar環境で評価し、ゼロショット一般化性とロバストネスをテストする。
実験結果
リサーチクエスチョン
- RQ1理論的根拠に基づいたフレームワーク(例:ミラー学習)上でメタラーニングを実施することで、手作業で設計されたベースラインを上回るRLアルゴリズムを発見できるか?
- RQ2学習されたドリフト関数にどのような行動的パターンが現れ、ポリシー最適化の向上に寄与するか?
- RQ3学習されたニューラルネットワークベースのドリフト関数から得られる知見を、性能損ないなしにシンプルな閉形式アルゴリズムに蒸留できるか?
- RQ4発見されたアルゴリズムは、訓練分布外の環境に対してもハイパーパrameterチューニングなしで一般化できるか?
- RQ5メタラーニングで得られたアルゴリズムは、理論的収束保証を継承しつつ、最先端の性能を達成できるか?
主な発見
- Learnt Policy Optimisation(LPO)は、ハイパーパrameterチューニングなしで、Brax環境の全タスクにおいてSOTA性能を達成し、PPOを上回る。
- Discovered Policy Optimisation(DPO)は、Brax環境のすべてでLPOと同等の性能を示し、2行の閉形式解析的更新ルールであるにもかかわらず、PPOを上回る。
- DPOはMinatar環境にも一般化し、PPOのチューニング済ハイパーパrameterで評価しても、強力な性能を維持する。ゼロショット転送のロバスト性を示している。
- LPOの分析から、2つの主要な行動的特徴が同定された:高利得行動に対する慎重な楽観主義と、低報酬行動に対するロールバック。これらがLPOの成功の鍵である。
- DPOのドリフト関数は、ReLUおよびtanh部を用いて、これらの特徴を明示的に再現するように設計されており、定数α=2およびβ=0.6を用いる。また、ミラー学習の収束に必要なドリフト条件を満たす。
- LPOおよびDPOは、PPOに比べてランダムシードにわたる一貫性が高く、訓練のばらつきに対するロバストネスが向上している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。