Skip to main content
QUICK REVIEW

[論文レビュー] Masked Autoencoding for Scalable and Generalizable Decision Making

Fangchen Liu, Hao Liu|arXiv (Cornell University)|Nov 23, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本論文では、強化学習のための自己教師付き事前学習手法であるマスクド意思決定予測(MaskDP)を提案する。この手法は、状態・行動の軌道にマスクドオートエンコーダを適用することで、一般化可能でスケーラブルなエージェントを学習する。状態と行動をランダムにマスクし、それらを再構築することで、ゴール到達およびオフライン強化学習タスクへのゼロショット転送を可能にし、従来手法を上回る性能を示し、モデルサイズの増大に伴い強いスケーラビリティを示す。

ABSTRACT

We are interested in learning scalable agents for reinforcement learning that can learn from large-scale, diverse sequential data similar to current large vision and language models. To this end, this paper presents masked decision prediction (MaskDP), a simple and scalable self-supervised pretraining method for reinforcement learning (RL) and behavioral cloning (BC). In our MaskDP approach, we employ a masked autoencoder (MAE) to state-action trajectories, wherein we randomly mask state and action tokens and reconstruct the missing data. By doing so, the model is required to infer masked-out states and actions and extract information about dynamics. We find that masking different proportions of the input sequence significantly helps with learning a better model that generalizes well to multiple downstream tasks. In our empirical study, we find that a MaskDP model gains the capability of zero-shot transfer to new BC tasks, such as single and multiple goal reaching, and it can zero-shot infer skills from a few example transitions. In addition, MaskDP transfers well to offline RL and shows promising scaling behavior w.r.t. to model size. It is amenable to data-efficient finetuning, achieving competitive results with prior methods based on autoregressive pretraining.

研究の動機と目的

  • 多様なダウンストリームタスクに一般化可能なスケーラブルな自己教師付き事前学習手法を強化学習に開発すること。
  • タスク固有のファインチューニングなしに、ゴール到達およびオフライン強化学習タスクへのゼロショット転送を可能にすること。
  • 視覚および言語モデルにインspiredされた非自己回帰的でマスクされたトークン予測の、順序付き意思決定における有効性を調査すること。
  • 事前学習中にマスク率を変化させることで、一般化性能およびダウンストリーム性能に与える影響を調査すること。
  • MaskDPが多様でラベルなしの順序付きデータから学習可能であり、自己回帰的事前学習手法と同等の性能を達成できることを示すこと。

提案手法

  • MaskDPは、状態・行動トークンの一部をランダムにマスクすることで、状態・行動の軌道にマスクドオートエンコーディングを適用する。
  • 変換器ベースのアーキテクチャを用いて、マスクされたトークンを再構築し、同じ学習信号から前向きおよび逆方向のダイナミクスを学習する。
  • 事前学習中に複数のマスク率(15%、35%、75%、95%)を用い、各シーケンスをランダムに選択された比率でサンプリングすることで、一般化性能を向上させる。
  • モデルは多様でラベルなしの順序付きデータで事前学習され、その後、ダウンストリームタスク用に最小限のデータでファインチューニングされる。
  • マスク済みおよびマスクされていないトークンの再構築を組み合わせた総損失関数が訓練中に使用され、これは、単一のマスク損失を使用する場合よりも経験的に収束が速い。
  • 本手法は、ゼロショットゴール到達、順序付きゴールタスク、オフライン強化学習ベンチマークで評価され、自己回帰的ベースライン(例:Goal-GPT)と性能を比較している。

実験結果

リサーチクエスチョン

  • RQ1状態・行動の軌道にマスクドオートエンコーディングを適用することで、多様なダウンストリーム強化学習タスクへのゼロショット転送が可能になるか?
  • RQ2事前学習中のマスク率を変化させることで、一般化性能およびダウンストリーム性能に与える影響は何か?
  • RQ3自己回帰的でないマスク予測アプローチは、オフライン強化学習およびゴール到達タスクにおいて、自己回帰的事前学習を上回る性能を示すか?
  • RQ4MaskDPはモデルサイズの増大に伴い効果的にスケーリング可能であり、より大きなアーキテクチャにおいても性能向上を維持できるか?
  • RQ5データ効率性およびゼロショット転送の観点から、Goal-GPTなどの自己回帰的事前学習手法と比較して、MaskDPはどのように異なるか?

主な発見

  • MaskDPは、ゼロショット設定下でも、トレーニングから再学習する手法や事前学習ベースの手法を上回る性能を達成し、単一ゴール到達タスクで同等または優れた結果を示している。
  • 順序付き複数ゴール到達タスクでは、MaskDPは反復的ベースラインを著しく上回り、クローズドループ実行なしにマルチステップの軌道計画に成功している。
  • MaskDPはオフライン強化学習への強い転送性能を示し、専用のオフライン強化学習手法と同等の性能を達成し、ウォーカー領域において最先端の結果を記録している。
  • モデルは強力なスケーラビリティを示しており、MaskDP事前学習からファインチューニングされた大規模モデルは、常に小規模モデルを上回る性能を示している。これは、Goal-GPTとは対照的で、その場合の性能向上は限定的である。
  • 混合マスク率戦略(15%、35%、75%、95%)は、固定比率のベースラインを著しく上回り、95%マスクが意味のある再構築に最も効果的であることが判明した。
  • 総損失(マスク済み+マスクされていない)を使用して訓練することで、クリーンなエキスパートデータでさえも、単一のマスク損失を使用する場合よりも収束が速くなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。