Skip to main content
QUICK REVIEW

[論文レビュー] Reincarnating Reinforcement Learning: Reusing Prior Computation to Accelerate Progress

Rishabh Agarwal, Max Schwarzer|arXiv (Cornell University)|Jun 3, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本稿では、再訓練強化学習(RRL)というフレームワークを紹介する。RRLは、事前学習済みポリシーおよびリプレイバッファなどの既存の計算作業を再利用することで、設計の反復やエージェント間のトレーニングを高速化する。QDaggerに基づくオフライン事前学習とオンラインファインチューニングを採用することで、RRLは、最大95%のフレーム数削減で、タブララサトレーニングと同等の性能を達成し、Atari、ロケモーション、および現実世界の風船ナビゲーションタスクにおいて顕著なサンプル効率性を示した。

ABSTRACT

Learning tabula rasa, that is without any prior knowledge, is the prevalent workflow in reinforcement learning (RL) research. However, RL systems, when applied to large-scale settings, rarely operate tabula rasa. Such large-scale systems undergo multiple design or algorithmic changes during their development cycle and use ad hoc approaches for incorporating these changes without re-training from scratch, which would have been prohibitively expensive. Additionally, the inefficiency of deep RL typically excludes researchers without access to industrial-scale resources from tackling computationally-demanding problems. To address these issues, we present reincarnating RL as an alternative workflow or class of problem settings, where prior computational work (e.g., learned policies) is reused or transferred between design iterations of an RL agent, or from one RL agent to another. As a step towards enabling reincarnating RL from any agent to any other agent, we focus on the specific setting of efficiently transferring an existing sub-optimal policy to a standalone value-based RL agent. We find that existing approaches fail in this setting and propose a simple algorithm to address their limitations. Equipped with this algorithm, we demonstrate reincarnating RL's gains over tabula rasa RL on Atari 2600 games, a challenging locomotion task, and the real-world problem of navigating stratospheric balloons. Overall, this work argues for an alternative approach to RL research, which we believe could significantly improve real-world RL adoption and help democratize it further. Open-sourced code and trained agents at https://agarwl.github.io/reincarnating_rl.

研究の動機と目的

  • 大規模および現実世界の応用において、タブララサから強化学習エージェントをトレーニングする際の高い計算コストと非効率性に対処すること。
  • 工業的規模のリソースを持たない研究者が、既存のポリシーとデータを再利用することで、複雑な強化学習問題に取り組めるようにすること。
  • エージェントの反復やエージェント間で過去の計算作業を活用する、新たな研究ワークフロー「再訓練強化学習」を形式化すること。
  • オフライン事前学習とオンラインファインチューニングを介して、劣化した教師ポリシーから学生エージェントへ知識を転送することで、強化学習におけるサンプル効率性を向上させること。
  • RRLが、はるかに少ないトレーニングフレーム数でタブララサトレーニングの性能を同等または上回ることを実証すること。

提案手法

  • 2段階のRRLパイプラインを提案:教師ポリシーから得られるリプレイバッファを用いたオフライン事前学習の後、学生エージェントによるオンラインファインチューニング。
  • オフラインおよびオンラインの両フェーズでQDagger損失を用いて、学生の価値関数を教師の行動と一致させる。
  • 学生が専門家のデモンストレーション(リプレイバッファ経由)から学び、オンライン相互作用を通じて改善する、蒸留に類似したプロセスを採用。
  • DQNベースの教師から、独立した価値ベースの学生エージェント(例:DQNまたはRainbow)へ知識を転送する手法を適用。
  • 10種類のAtariゲームで、50のシードと95%信頼区間を用いて、人間正規化スコアとIQM(四分位平均)を評価指標に使用。
  • カリキュラムスタイルのトレーニングを採用:大規模なリプレイバッファを用いたオフライン事前学習の後、学習率を低く抑えて安定化を図るオンラインRL。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みポリシーおよびそのリプレイバッファなどの、過去の計算作業を、強化学習のトレーニングを高速化するために効果的に再利用できるか?
  • RQ2劣化した教師ポリシーから、オフライン事前学習とオンラインファインチューニングを介して学生エージェントへ知識を転送することで、タブララサトレーニングを上回る性能が得られるか?
  • RQ3オフラインリプレイバッファのサイズが再訓練プロセスの性能に与える影響は何か?
  • RQ4標準的なQ学習と比較して、オフラインおよびオンラインフェーズの両方でQDagger損失を使用した場合の影響は何か?
  • RQ5RRLは、挑戦的な強化学習ベンチマークで、顕著にサンプル複雑性を低減しつつ、性能を維持または向上させることができるか?

主な発見

  • 再訓練強化学習は、ファインチューニング後に追加で100万フレームを追加するだけで、タブララサDQN(Adam)と比較してIQM性能が50%高い。
  • ファインチューニング後にAdam最適化子を用いてNature DQNをファインチューニングした場合、4億フレームのタブララサDQN(Adam)と同等の性能を、わずか2000万フレームで達成した。
  • DQNポリシーから得たReincarnating Impala-CNN Rainbowを再訓練した結果、タブララサImpala-CNN Rainbowを上回り、1億フレームの性能をわずか5000万フレームで達成した。
  • 教師ポリシーからの遷移を50万件のみ使用しても、100万件と同等の性能を達成したが、Asterixではわずかに性能が低下した。
  • 教師トレーニング中に多様なポリシーで収集されたオフラインリプレイデータは、オンポリシーのデータよりも優れたデータ多様性を提供し、性能向上に寄与した。
  • オフラインおよびオンラインフェーズの両方でQDagger損失を使用した場合、特にリプレイバッファサイズが限られた状況(BLEロケーションタスクなど)で優れた結果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。