Skip to main content
QUICK REVIEW

[論文レビュー] Representation Matters: Offline Pretraining for Sequential Decision Making

Mengjiao Yang, Ofir Nachum|arXiv (Cornell University)|Feb 11, 2021
Reinforcement Learning in Robotics参考文献 49被引用数 22
ひとこと要約

本論文では、オフラインデータセット上で対照的自己予測を用いた事前学習により、下流の順序的意思決定タスクの性能を向上させる状態表現を提案する。状態、行動、報酬の部分軌道から不変で予測可能な表現を学習することで、模倣学習、オフライン強化学習、オンライン強化学習の各タスクで顕著な性能向上を達成した。これは、表現学習が多様な強化学習設定においてデータ効率の良い方策学習の基盤として強力である可能性を示している。

ABSTRACT

The recent success of supervised learning methods on ever larger offline datasets has spurred interest in the reinforcement learning (RL) field to investigate whether the same paradigms can be translated to RL algorithms. This research area, known as offline RL, has largely focused on offline policy optimization, aiming to find a return-maximizing policy exclusively from offline data. In this paper, we consider a slightly different approach to incorporating offline data into sequential decision-making. We aim to answer the question, what unsupervised objectives applied to offline datasets are able to learn state representations which elevate performance on downstream tasks, whether those downstream tasks be online RL, imitation learning from expert demonstrations, or even offline policy optimization based on the same offline dataset? Through a variety of experiments utilizing standard offline RL datasets, we find that the use of pretraining with unsupervised learning objectives can dramatically improve the performance of policy learning algorithms that otherwise yield mediocre performance on their own. Extensive ablations further provide insights into what components of these unsupervised objectives -- e.g., reward prediction, continuous or discrete representations, pretraining or finetuning -- are most important and in which settings.

研究の動機と目的

  • オフラインデータセットにおける自己教師あり表現学習が、多様な下流の順序的意思決定タスクの性能向上に寄与するかどうかを調査すること。
  • 特に対照的自己予測を含む、自己教師あり目的関数の中で、方策学習に最も効果的な状態表現を生成するものは何かを特定すること。
  • 標準的な D4RL ベンチマークを用いて、表現学習が模倣学習、オフライン強化学習、オンライン強化学習に与える影響を評価すること。
  • 表現学習のどの要素(例:行動・報酬予測、ネットワークアーキテクチャ、微調整)が性能に最も寄与するかを同定すること。
  • 特定の表現目的が異なる強化学習パラダイムにどのように一般化するかについての実証的洞察を提供すること。

提案手法

  • オフラインデータの部分軌道上で対照的自己予測を用い、ニューラルネットワークエンコーダ φ(s) が生の観測値を固定長の埋め込みにマップするように事前学習する。
  • 正例ペア(例:状態と行動の系列と次の状態)間の一致を最大化し、負例ペア間の一致を最小化するための対照的損失を適用する。
  • 模倣学習、オフライン強化学習、オンライン強化学習の各設定において、事前学習済み表現 φ(s) を下流のポリシー・ネットワークの入力として使用する。
  • 異なるアーキテクチャ(例:トランスフォーマー)とトレーニング戦略(例:微調整、モーメンタムネットワーク)を用いて、行動・報酬予測を含む対照的目的の複数のバリエーションを評価する。
  • 行動・報酬の含む有無、双方向トランスフォーマー、コンテキスト埋め込み、補助損失の有無といった要因の影響を分離するためのアブレーションスタディを実施する。
  • アブレーションのベースラインスケルトンとして、強い実証的性能を示すトランスフォーマー型 ACL 目的の実装を用いる。

実験結果

リサーチクエスチョン

  • RQ1オフラインデータセットにおける自己教師あり表現学習は、下流の模倣学習、オフライン強化学習、オンライン強化学習の性能向上に寄与するか?
  • RQ2特に対照的自己予測を含む、特定の自己教師あり目的関数の中で、異なる強化学習タスクに最も効果的な状態表現を生成するのはどれか?
  • RQ3行動・報酬予測、ネットワークアーキテクチャ、微調整戦略といった要素が、下流の性能にどのように影響を与えるか?
  • RQ4自然言語処理やオンライン強化学習で有効な表現学習目的が、オフライン強化学習設定にも効果的に一般化するか?
  • RQ5すべての下流タスクで優れた性能を発揮する「最適な」表現目的が存在するのか、それとも性能はタスクの種別に依存するのか?

主な発見

  • 対照的自己予測目的、特に状態と行動の系列から将来の状態を予測するものにより、模倣学習、オフライン強化学習、オンライン強化学習のすべてのタスクで顕著な性能向上が達成された。
  • 模倣学習は状態のみの対照的学習で最も利益を受けるが、オフラインおよびオンライン強化学習では行動と報酬を予測対象に含めることで性能が向上する。
  • 表現 φ(s) から行動と報酬を再構築することは、強化学習設定では一貫した改善をもたらすが、模倣学習の性能を低下させることがあり、目的間のトレードオフが生じていることを示している。
  • 自然言語処理で一般的なコンテキスト埋め込みと双方向トランスフォーマーは、模倣学習では性能を著しく低下させ、強化学習でも混合した結果を示し、オフライン強化学習においては普遍的ではない利点を示している。
  • オンライン強化学習では表現目的を補助損失として用いることで性能向上が見られたが、オフライン強化学習では著しく性能が低下した。これは、オンラインとオフラインのトレーニングダイナミクスの間で重大な不一致があることを示している。
  • 表現ネットワークの微調整は一部のドメインでオンライン強化学習の性能を向上させるが、模倣学習およびオフライン強化学習ではわずかな低下を引き起こす。これは、タスク固有の感受性があることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。