Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Fine-Tuning: Transferring Behavior in Reinforcement Learning

Víctor Campos, Pablo Sprechmann|arXiv (Cornell University)|Feb 24, 2021
Reinforcement Learning in Robotics参考文献 59被引用数 12
ひとこと要約

本稿では、報酬なしの段階で内在的欲求(NGU)を用いて事前学習された方策を活用し、下流の強化学習タスクにおける構造的探索を実現する、行動転送(BT)という手法を提案する。BTは重みの微調整を補完するものであり、事前学習済み方策を探索戦略および擬似アクションとして用いることで、モンテズマのレインボーやディフェンダーなど、複雑な環境において、特に事前学習された行動がタスクと整合しない場合に優れた性能を発揮する。

ABSTRACT

Designing agents that acquire knowledge autonomously and use it to solve new tasks efficiently is an important challenge in reinforcement learning. Knowledge acquired during an unsupervised pre-training phase is often transferred by fine-tuning neural network weights once rewards are exposed, as is common practice in supervised domains. Given the nature of the reinforcement learning problem, we argue that standard fine-tuning strategies alone are not enough for efficient transfer in challenging domains. We introduce Behavior Transfer (BT), a technique that leverages pre-trained policies for exploration and that is complementary to transferring neural network weights. Our experiments show that, when combined with large-scale pre-training in the absence of rewards, existing intrinsic motivation objectives can lead to the emergence of complex behaviors. These pre-trained policies can then be leveraged by BT to discover better solutions than without pre-training, and combining BT with standard fine-tuning strategies results in additional benefits. The largest gains are generally observed in domains requiring structured exploration, including settings where the behavior of the pre-trained policies is misaligned with the downstream task.

研究の動機と目的

  • 事前学習後の下流RLタスクにおける非構造的探索の非効率性を解消すること。
  • 微調整中に事前学習済み行動を保持することで、方策転送における深刻な忘却を回避すること。
  • 構造的で長時間にわたる探索を要する環境におけるより効果的な転送を可能にすること。
  • 事前学習済み行動をニューラルネットワークの重みとは独立して活用することで、サンプル効率の向上を実現できることを示すこと。
  • BTと重み微調整の相乗効果が、挑戦的なRLベンチマークでどの程度発揮されるかを調査すること。

提案手法

  • 報酬なしの環境で、内在的欲求(NGU)の報酬目的を用いて方策を事前学習し、複雑な探索的行動を学習する。
  • 事前学習済み方策を時間的に拡張された探索戦略として用いる:訓練中に一時的にランダムに有効化し、複数ステップにわたり実行する。
  • 事前学習済み方策をエージェントのアクション空間に擬似アクションとして導入し、エージェントが行動選択をそれにお任せできるようにする。
  • BTを標準的な重み微調整と組み合わせ、ニューラルネットワークのエンコーダ重みを事前学習済み重みで初期化する。
  • BTを介して収集された経験と事前学習済み行動を活用できる、オフポリシー学習アルゴリズム(例:R2D2)を適用する。
  • 報酬の疎らさや事前学習済み行動とのタスク整合性に差がある多様なAtari環境でBTを評価する。

実験結果

リサーチクエスチョン

  • RQ1報酬なしに学習された事前学習済み方策は、下流RLタスクにおける探索に有効に再利用可能か?
  • RQ2事前学習済み行動が下流タスクと整合しない場合、行動転送(BT)は標準的な微調整を上回るか?
  • RQ3多様な環境において、BTと微調整のサンプル効率および最終的パフォーマンスの違いは何か?
  • RQ4BTと重み微調整は、複雑で報酬が疎らな環境において、どの程度相乗効果を発揮するか?
  • RQ5内在的欲求の目的(例:NGU)は、報酬の監視なしに有効な転送を可能にするような事前学習済み方策を生成できるか?

主な発見

  • BTは、モンテズマのレインボーやディフェンダーといった、事前学習済み行動がタスクと整合しない環境で、標準的な微調整を著しく上回り、それぞれ13,265.91 ± 372.02および566,938.61 ± 2,428.52の最終スコアを達成した。
  • 報酬が疎らなMs. Pac-Man(ハード)では、BTが7,868 ± 1,085を達成し、R2D2(2,836 ± 26)および微調整済みNGU(1,891 ± 1,342)を上回った。
  • 偽の報酬があるヒーロー環境では、BTが3,547 ± 122を達成し、R2D2(2,677 ± 23)および微調整済みNGU(700 ± 0)を上回った。
  • BTと完全な重み初期化を組み合わせた場合、最高のパフォーマンスが得られ、BT(π_NGU)は「Up N Down」で582,923.55 ± 2,849.01を達成した。これは、微調整のみの場合の562,739.02 ± 8,527.59を上回った。
  • 事前学習済み方策が下流タスクでうまくいかない場合(一部のバージョンで負のスコアをとる場合も)でも、BTは高いパフォーマンスを維持しており、行動の不整合に対してもロバストであることが示された。
  • アブレーションスタディの結果、飛行ベースの探索と擬似アクションの使用が、それぞれ独立してパフォーマンス向上に寄与しており、両者の組み合わせがゲーム全体で最良の結果をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。