Skip to main content
QUICK REVIEW

[論文レビュー] Discovered Policy Optimisation

Chris Xiaoxuan Lu, Jakub Grudzien Kuba|arXiv (Cornell University)|Oct 11, 2022
Machine Learning and Data Classification被引用数 16
ひとこと要約

本稿では、ミラー学習フレームワーク内でのメタラーニングを用いて発見された、新しい深層強化学習アルゴリズムであるDPO(Discovered Policy Optimisation)を紹介する。進化戦略を用いてニューラルネットワークのドリフト関数をメタ最適化することで、まずLearnt Policy Optimisation(LPO)を学習し、その後その行動的洞察(慎重な楽観主義とロールバック)を閉形式で理論的に整合性のあるアルゴリズムDPOに蒸留する。DPOはLPOと同等の性能を達成し、ハイパーパrameterチューニングなしでBrax環境においてPPOを上回る性能を示す。

ABSTRACT

Tremendous progress has been made in reinforcement learning (RL) over the past decade. Most of these advancements came through the continual development of new algorithms, which were designed using a combination of mathematical derivations, intuitions, and experimentation. Such an approach of creating algorithms manually is limited by human understanding and ingenuity. In contrast, meta-learning provides a toolkit for automatic machine learning method optimisation, potentially addressing this flaw. However, black-box approaches which attempt to discover RL algorithms with minimal prior structure have thus far not outperformed existing hand-crafted algorithms. Mirror Learning, which includes RL algorithms, such as PPO, offers a potential middle-ground starting point: while every method in this framework comes with theoretical guarantees, components that differentiate them are subject to design. In this paper we explore the Mirror Learning space by meta-learning a "drift" function. We refer to the immediate result as Learnt Policy Optimisation (LPO). By analysing LPO we gain original insights into policy optimisation which we use to formulate a novel, closed-form RL algorithm, Discovered Policy Optimisation (DPO). Our experiments in Brax environments confirm state-of-the-art performance of LPO and DPO, as well as their transfer to unseen settings.

研究の動機と目的

  • ハイパーパrameter感受性やロバストネスの欠如といった、手作業で設計されたRLアルゴリズムの限界を克服するため、アルゴリズム発見の自動化を目的とする。
  • 収束性と安定性を保証する理論的根拠に基づいたフレームワーク、特にミラー学習におけるアルゴリズム発見を探索する。
  • ドリフト関数のメタラーニングを通じて、人間の直感に依存せずに、高性能で汎用性の高いRLアルゴリズムを発見する。
  • 学習されたニューラルネットワークベースのドリフト関数から得られる知見を、実用的導入を想定したシンプルな閉形式アルゴリズムに蒸留する。

提案手法

  • 進化戦略(ES)を用いて、ミラー学習フレームワークにおけるドリフト関数のニューラルネットワークパラメータ化をメタラーニングする。
  • 複数のシードで性能を最適化する目的で、Brax環境のサブセット(特にAnt)でドリフト関数を訓練する。
  • 学習されたLPOドリフト関数を分析し、高報酬行動に対する慎重な楽観主義や低報酬行動に対するロールバックといった、重要なアルゴリズム的行動を同定する。
  • ReLUおよびtanh活性化関数を用いて、LPOの主要な行動を再現する閉形式でパラメータフリーのドリフト関数を導出する——これが、DPO(Discovered Policy Optimisation)である。
  • 報酬の利得の符号と行動報酬履歴に依存する、2行の解析的更新ルールとしてDPOを実装する。
  • LPOおよびDPOを、学習時とは異なるBrax環境およびMinatar環境で評価し、ゼロショット一般化性とロバストネスをテストする。

実験結果

リサーチクエスチョン

  • RQ1理論的根拠に基づいたフレームワーク(例:ミラー学習)上でメタラーニングを実施することで、手作業で設計されたベースラインを上回るRLアルゴリズムを発見できるか?
  • RQ2学習されたドリフト関数にどのような行動的パターンが現れ、ポリシー最適化の向上に寄与するか?
  • RQ3学習されたニューラルネットワークベースのドリフト関数から得られる知見を、性能損ないなしにシンプルな閉形式アルゴリズムに蒸留できるか?
  • RQ4発見されたアルゴリズムは、訓練分布外の環境に対してもハイパーパrameterチューニングなしで一般化できるか?
  • RQ5メタラーニングで得られたアルゴリズムは、理論的収束保証を継承しつつ、最先端の性能を達成できるか?

主な発見

  • Learnt Policy Optimisation(LPO)は、ハイパーパrameterチューニングなしで、Brax環境の全タスクにおいてSOTA性能を達成し、PPOを上回る。
  • Discovered Policy Optimisation(DPO)は、Brax環境のすべてでLPOと同等の性能を示し、2行の閉形式解析的更新ルールであるにもかかわらず、PPOを上回る。
  • DPOはMinatar環境にも一般化し、PPOのチューニング済ハイパーパrameterで評価しても、強力な性能を維持する。ゼロショット転送のロバスト性を示している。
  • LPOの分析から、2つの主要な行動的特徴が同定された:高利得行動に対する慎重な楽観主義と、低報酬行動に対するロールバック。これらがLPOの成功の鍵である。
  • DPOのドリフト関数は、ReLUおよびtanh部を用いて、これらの特徴を明示的に再現するように設計されており、定数α=2およびβ=0.6を用いる。また、ミラー学習の収束に必要なドリフト条件を満たす。
  • LPOおよびDPOは、PPOに比べてランダムシードにわたる一貫性が高く、訓練のばらつきに対するロバストネスが向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。