Skip to main content
QUICK REVIEW

[論文レビュー] Can Wikipedia Help Offline Reinforcement Learning?

Machel Reid, Yutaro Yamada|arXiv (Cornell University)|Jan 28, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

この論文では、強化学習を系列モデルとして扱うことで、GPT2 や Wikipedia で事前学習された ChibiT などの事前学習済み言語モデルをオフライン強化学習に微調整する手法を提案する。D4RL Gym および Atari ベンチマークにおいて、3〜6倍の高速化と最先端の性能を達成し、自然言語の事前学習から強化学習タスクへの強力な転移を示している。

ABSTRACT

Fine-tuning reinforcement learning (RL) models has been challenging because of a lack of large scale off-the-shelf datasets as well as high variance in transferability among different environments. Recent work has looked at tackling offline RL from the perspective of sequence modeling with improved results as result of the introduction of the Transformer architecture. However, when the model is trained from scratch, it suffers from slow convergence speeds. In this paper, we look to take advantage of this formulation of reinforcement learning as sequence modeling and investigate the transferability of pre-trained sequence models on other domains (vision, language) when finetuned on offline RL tasks (control, games). To this end, we also propose techniques to improve transfer between these domains. Results show consistent performance gains in terms of both convergence speed and reward on a variety of environments, accelerating training by 3-6x and achieving state-of-the-art performance in a variety of tasks using Wikipedia-pretrained and GPT2 language models. We hope that this work not only brings light to the potentials of leveraging generic sequence modeling techniques and pre-trained models for RL, but also inspires future work on sharing knowledge between generative modeling tasks of completely different domains.

研究の動機と目的

  • 関連しないドメイン(例:言語)からの事前学習済み系列モデル(例:言語)が、オフライン強化学習の性能を向上させられるかどうかを調査すること。
  • Transformer を用いたオフライン強化学習モデルを、ランダム初期化から学習を開始する際の収束が遅い問題を解決すること。
  • 言語モデリングで学習した特徴量が、制御およびゲーム環境におけるオフライン強化学習にどれほど転移可能かを調査すること。
  • 拡張された位置埋め込みや埋め込み類似性の促進といった技術を通じて、言語と強化学習のドメイン間での特徴転移を向上させること。
  • 大規模な自然言語データでの事前学習が、モダリティの境界を越えて、オフライン強化学習における有効なインダクティブバイアスとして機能することを示すこと。

提案手法

  • 報酬を条件として、状態・行動・報酬の系列としての軌道をモデル化することで、オフライン強化学習を系列モデリングとして定式化する。
  • 系列モデリングの目的関数を用いて、オフライン強化学習データセット上で、事前学習済み自己回帰的言語モデル(例:GPT2、ChibiT)を微調整する。
  • 非言語的系列における時間的構造をよりよく捉えるために、拡張された位置埋め込みを導入する。
  • 微調整中に、言語と強化学習の系列の表現空間を一致させるために、埋め込み類似性の促進を適用する。
  • 因果マスクを用いた標準的なトランスフォーマー・デコーダー・アーキテクチャを用い、状態、報酬、報酬の条件に基づいて行動を自己回帰的にモデル化する。
  • 予測された行動と実際の行動との間の平均二乗誤差損失を用いて、オフラインデータセット上でモデルをエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1Wikipedia や同様のコーパスで事前学習された言語モデルが、制御およびゲーム環境におけるオフライン強化学習タスクに効果的に転移可能か?
  • RQ2自然言語での事前学習が、ランダム初期化と比較して、オフライン強化学習における収束速度と最終的な性能を向上させるか?
  • RQ3位置埋め込みの拡張や表現の一致といった技術が、言語から強化学習への転送をどのように向上させるか?
  • RQ4モデルサイズや事前学習ドメイン(言語対視覚)が、オフライン強化学習における性能に与える影響は何か?
  • RQ5系列モデリングに普遍的なインダクティブバイアスが存在し、言語から強化学習へのクロスドメイン転送を可能にしているか?

主な発見

  • GPT2 および Wikipedia で事前学習された ChibiT モデルをオフライン強化学習タスクに微調整することで、D4RL Gym および Atari ベンチマークで最先端の性能を達成した。
  • 本手法により、ランダム初期化から開始する通常の意思決定トランスフォーマーと比較して、トレーニングを3〜6倍高速化し、トレーニング時間を数時間から数十分に短縮した。
  • 自然言語での事前学習は、視覚ベースの事前学習やランダム初期化よりも顕著に優れた性能を示し、言語固有のインダクティブバイアスが有益であることを示している。
  • 位置埋め込みの拡張と、言語と強化学習の系列間での埋め込み類似性の促進により、微調整中の性能と安定性が向上した。
  • 多様な環境にわたり一貫した向上が見られたことから、タスクやドメインにかかわらず、強力な転送可能性を示している。
  • パラメータを凍結するのではなく、モデル全体を微調整することでより良い結果が得られたことから、強化学習の分布への適応の重要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。