Skip to main content
QUICK REVIEW

[論文レビュー] Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning

Ruizhe Shi, Yuyao Liu|arXiv (Cornell University)|Oct 31, 2023
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、事前学習言語モデル(LM)を活用してオフライン強化学習(RL)を向上させるフレームワークLaMoを提案する。LaMoは、言語モデルで初期化された意思決定変換器を用い、LoRAによるパラメータ効率の良い微調整、線形投影の非線形MLPへの置き換え、および言語予測の補助損失の追加を行う。LaMoはスパース報酬タスクで最先端の性能を達成し、特に低データ環境下において、価値ベース手法との性能差を顕著に縮小する。

ABSTRACT

Offline reinforcement learning (RL) aims to find a near-optimal policy using pre-collected datasets. In real-world scenarios, data collection could be costly and risky; therefore, offline RL becomes particularly challenging when the in-domain data is limited. Given recent advances in Large Language Models (LLMs) and their few-shot learning prowess, this paper introduces $ extbf{La}$nguage Models for $ extbf{Mo}$tion Control ($ extbf{LaMo}$), a general framework based on Decision Transformers to effectively use pre-trained Language Models (LMs) for offline RL. Our framework highlights four crucial components: (1) Initializing Decision Transformers with sequentially pre-trained LMs, (2) employing the LoRA fine-tuning method, in contrast to full-weight fine-tuning, to combine the pre-trained knowledge from LMs and in-domain knowledge effectively, (3) using the non-linear MLP transformation instead of linear projections, to generate embeddings, and (4) integrating an auxiliary language prediction loss during fine-tuning to stabilize the LMs and retain their original abilities on languages. Empirical results indicate $ extbf{LaMo}$ achieves excellent performance in sparse-reward tasks and closes the gap between value-based offline RL methods and decision transformers in dense-reward tasks. In particular, our method demonstrates superior performance in scenarios with limited data samples.

研究の動機と目的

  • 事前学習言語モデル(LLM)を活用して、オフライン強化学習におけるデータ不足の課題を克服し、より高いサンプル効率を実現すること。
  • 従来の手法が意思決定タスクにおけるLMのインダクティブバイアスおよび少数ショット一般化能力を十分に活用できないという限界を克服すること。
  • 最小限のパラメータ更新で事前学習LMの知識を保持しつつ、オフラインRL環境に効果的に適応できるフレームワークを設計すること。
  • 標準的なオフラインRL手法が苦戦するスパース報酬および低データ環境での性能向上を図ること。
  • アblationと包括的な評価を通じて、LMと意思決定変換器を組み合わせることの有効性を検証すること。

提案手法

  • GPT-2などの事前学習言語モデル(例:GPT-2)を用いて意思決定変換器を初期化し、一般的な世界知識とインダクティブバイアスを注入すること。
  • パラメータ効率の良い微調整のためのLoRA(低ランク適応)を適用し、事前学習LMの重みは固定したまま、モデルパラメータの0.7%のみを更新すること。
  • 標準的な線形入力埋め込みと出力投影を、非線形な多層パーセプトロン(MLP)に置き換えることで、状態と行動の非線形関係をよりよく捉えること。
  • 微調整中に補助言語予測損失を導入し、学習の安定化とLMの元来の言語理解能力の保持を図ること。
  • 言語記述を経由せず、直接的に生の状態と行動観測を処理することで、連続制御およびビジョンベースのタスクへの適用を可能にすること。
  • データ比を変化させたMuJoCo、Kitchen、Atari環境を対象に評価し、サンプル効率とロバストネスを評価すること。

実験結果

リサーチクエスチョン

  • RQ1事前学習言語モデルは、オフライン強化学習におけるサンプル効率の向上に効果的に活用可能か?
  • RQ2事前学習LMで初期化された意思決定変換器をLoRAで微調整することで、標準的なDTや価値ベース手法よりも優れた性能が得られるか?
  • RQ3非線形MLPによる投影と補助言語損失は、LMベースのオフラインRLエージェントの安定性と性能にどのように影響するか?
  • RQ4LMベースのモデルは、特にスパース報酬環境下で、低データ環境下においてどの程度一般化可能か?
  • RQ5事前学習知識をLMから統合することで、意思決定変換器ベースと価値ベースのオフラインRL手法の性能差は縮小するか?

主な発見

  • LaMoはD4RLベンチマークにおけるスパース報酬タスクで最先端の性能を達成し、意思決定変換器と保守的Q学習(CQL)手法を上回った。
  • 密度の高い報酬タスクでは、LaMoが意思決定変換器ベースと価値ベース手法の性能差を顕著に縮小し、特に低データ比下で顕著であった。
  • 1%のデータ利用率下で、LaMoはスパース報酬タスクで平均スコア36.7を達成し、DT(31.6)と事前学習なしのLaMo(23.3)を上回った。これは優れたデータ効率性を示している。
  • アブレーションスタディにより、事前学習が極めて重要であることが確認された。スパース報酬タスクでは、事前学習を削除すると平均で10点以上性能が低下した。
  • 非線形MLPと補助言語損失の使用により、学習がより安定し、言語能力の保持が向上した。ゼロショット一般化性能の向上と評価時の分散低減が観察された。
  • ランダム初期化の重みを用いても、LoRAと深く埋め込まれたモデルは標準的なDTを上回った。これは、アーキテクチャのスケーリングとパラメータ効率の良い適応が、独立して有益であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。