[論文レビュー] SMART: Self-supervised Multi-task pretrAining with contRol Transformers
SMARTは、オффラインのトラジェクトリから報酬に依存しない表現を学ぶ制御Transformer(CT)を用いた自己教師付きマルチタスク事前学習フレームワークを提案する。前向きダイナミクス、逆ダイナミクス、マスクされた後向き制御の目的関数を組み合わせることで、低品質またはランダムな事前学習データでさえも、多様な示範学習(IL)および強化学習(RL)タスクにおいて最先端の転移性能を達成する。
Self-supervised pretraining has been extensively studied in language and vision domains, where a unified model can be easily adapted to various downstream tasks by pretraining representations without explicit labels. When it comes to sequential decision-making tasks, however, it is difficult to properly design such a pretraining approach that can cope with both high-dimensional perceptual information and the complexity of sequential control over long interaction horizons. The challenge becomes combinatorially more complex if we want to pretrain representations amenable to a large variety of tasks. To tackle this problem, in this work, we formulate a general pretraining-finetuning pipeline for sequential decision making, under which we propose a generic pretraining framework extit{Self-supervised Multi-task pretrAining with contRol Transformer (SMART)}. By systematically investigating pretraining regimes, we carefully design a Control Transformer (CT) coupled with a novel control-centric pretraining objective in a self-supervised manner. SMART encourages the representation to capture the common essential information relevant to short-term control and long-term control, which is transferrable across tasks. We show by extensive experiments in DeepMind Control Suite that SMART significantly improves the learning efficiency among seen and unseen downstream tasks and domains under different learning scenarios including Imitation Learning (IL) and Reinforcement Learning (RL). Benefiting from the proposed control-centric objective, SMART is resilient to distribution shift between pretraining and finetuning, and even works well with low-quality pretraining datasets that are randomly collected.
研究の動機と目的
- 動的特性、報酬関数、アクション空間が異なる多様な逐次意思決定タスクに適した汎用的で転移可能な表現を事前学習する課題に対処すること。
- 特に、非最適またはランダムなポリシーから収集されたデータを用いた事前学習と微調整の間で発生するデータ分布シフトを克服すること。
- タスク固有の適応なしに、示範学習(IL)および強化学習(RL)の両方の下流タスクをサポートできる統一された表現学習フレームワークを構築すること。
- 報酬信号に依存せずに、高次元観測から短期的および長期的ダイナミクスを捉える制御中心の事前学習目的を設計すること。
- 事前学習データが低品質または非エキスパートである場合でも、未踏のタスクやドメインに対して頑健で一般化可能な性能を確保すること。
提案手法
- 高次元観測から状態-アクション相互作用をモデル化する因果的アテンションに基づくアーキテクチャ、すなわち制御Transformer(CT)を導入する。
- 前向きダイナミクス予測、逆ダイナミクス予測、およびマスクされた後向き制御(Mask-Ctl)の3要素からなる、新しい制御中心の事前学習目的を設計する。
- マスクされた後向き制御を用いて、将来の状態からアクションを予測させることで、長期的な時系列的推論とポリシー不変のダイナミクス理解を促進する。
- 報酬信号やエキスパートのデモンストレーションにアクセスせずに、オフラインのトラジェクトリデータ上でCTを自己教師的に学習する。
- 報酬モデリングから表現学習を分離することで、ILおよびRLの両方の下流タスクとの互換性を確保する。
- 一部のバリアントでは対照的監視のためのモーメンタムエンコーダーを用いるが、主な結果ではコアな制御中心の目的に重点を置く。
実験結果
リサーチクエスチョン
- RQ1報酬の監視なしに、多様な逐次的意思決定タスクに対して転移可能な表現を効果的に学習できる自己教師付き事前学習フレームワークは存在するか?
- RQ2視覚的または言語的インスパイアドの目的関数と比較して、提案された制御中心の事前学習目的は、下流タスクの転移性能においてどのように優れているか?
- RQ3事前学習データがランダムまたは非エキスパートのポリシーから収集された場合、SMARTは未踏のタスクやドメインにどの程度一般化できるか?
- RQ4短期的(前向き/逆ダイナミクス)と長期的(マスクされた後向き制御)のダイナミクスモデリングの相対的寄与度は、全体の性能にどの程度影響を与えるか?
- RQ5補助的損失(例:マスクされた状態予測や対照的損失)を追加することで一般化性能が向上するか?また、どのような条件下でその効果が顕著になるか?
主な発見
- SMARTは、DeepMind Control Suiteにおける示範学習(BC)および強化学習(RL)の下流タスクにおいて、学習効率を顕著に向上させ、学習から開始する手法や先行のSOTA事前学習手法を上回る性能を達成した。
- アブレーションスタディにより、事前学習目的の3要素(前向きダイナミクス、逆ダイナミクス、マスクされた後向き制御)すべてが不可欠であることが確認され、いずれかを除去すると性能が低下した。
- SMARTは分布シフトに対して強い頑健性を示した:ランダムポリシーから収集されたデータを用いた場合でも、効果的に一般化でき、このような低品質データ環境下でもベースラインを上回った。
- 探索的データを用いた事前学習では、追加の損失を含まないオリジナルのSMART目的関数が最良の全体的性能を達成した。これは、コアな制御中心の設計が十分に効果的で安定していることを示している。
- マスクされた状態予測や対照的損失などの補助損失を追加すると、ランダム事前学習データの環境下では性能が向上するが、これは分布シフトが顕著な場合に視覚的表現をよりよく学習するのに寄与するためである。
- 128の実験設定(4バリアント × 2学習シナリオ × 2データセット選択 × 8下流タスク)において一貫した性能を維持したため、本フレームワークの多様性と信頼性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。