[論文レビュー] MUTEX: Learning Unified Policies from Multimodal Task Specifications
Mutexは、2段階の訓練プロセスを用いて、マスク化モデリングとクロスモーダルマッチングを活用し、テキスト、音声、画像、動画を含むマルチモーダルなタスク仕様から学習する統合型トランスフォーマー基盤のポリシー・ネットワークを提案する。シミュレーションおよび現実世界の両環境で、6つのモダリティタイプ(例:テキスト指示、動画デモ)において最先端の性能を達成し、スパarserなモダリティ(例:テキスト、音声)の補完的で豊富なクロスモーダル信号を活用することで、モダリティ特化型のベースラインを上回る。
Humans use different modalities, such as speech, text, images, videos, etc., to communicate their intent and goals with teammates. For robots to become better assistants, we aim to endow them with the ability to follow instructions and understand tasks specified by their human partners. Most robotic policy learning methods have focused on one single modality of task specification while ignoring the rich cross-modal information. We present MUTEX, a unified approach to policy learning from multimodal task specifications. It trains a transformer-based architecture to facilitate cross-modal reasoning, combining masked modeling and cross-modal matching objectives in a two-stage training procedure. After training, MUTEX can follow a task specification in any of the six learned modalities (video demonstrations, goal images, text goal descriptions, text instructions, speech goal descriptions, and speech instructions) or a combination of them. We systematically evaluate the benefits of MUTEX in a newly designed dataset with 100 tasks in simulation and 50 tasks in the real world, annotated with multiple instances of task specifications in different modalities, and observe improved performance over methods trained specifically for any single modality. More information at https://ut-austin-rpl.github.io/MUTEX/
研究の動機と目的
- 異なるモダリティ(テキスト、音声、画像、動画)のタスク仕様に応じて、各モダリティごとに別々のモデルを必要とせずに、統合型ロボットポリシーを構築すること。
- 既存の手法が各モダリティ(例:言語、動画、音声)を独立した問題として扱うための限界を是正すること。
- 複数のモダリティを同時に学習することで、未知のモダリティ組み合わせに一般化できるゼロショット一般化性能と耐性を向上させること。
- 特に豊富な動画デモから得られるクロスモーダルな自己教師信号を活用し、テキストや音声などスパarserなモダリティの表現を強化すること。
- 可変長のマルチモーダル入力を処理でき、同時に行動とマスクされた信号を予測できるスケーラブルなアーキテクチャを設計すること。
提案手法
- 固定長のロボット観測履歴を条件として、可変長のマルチモーダルなタスク仕様(例:テキスト、音声、画像、動画)に注目できるPerceiverスタイルのエンコーダーを用いる。
- 2段階の訓練手順を採用:第1段階では、混合モダリティでマスク化モデリングと行動クラーニングによる事前訓練;第2段階では、モダリティ間の表現を整えるためにクロスモーダルマッチングによる微調整。
- 各モダリティごとに別々にマスク化モデリング目的を適用:視覚的モダリティ(動画、画像のゴール)にはL1損失、テキストおよび音声モダリティには交差エントロピー損失。
- あるモダリティ(例:テキスト指示)の表現を、より情報量の多い動画デモの表現と一致させるために、クロスモーダルマッチング損失を導入。
- 第2段階でメインポリシーの重みを固定したまま、モダリティ特化型のプロジェクションヘッド(例:テキスト、音声、動画)を微調整。
- テキストと画像の埋め込みにはCLIP、音声にはWhisperを活用し、視覚入力にはR3M特徴量を用いることで、強力な事前学習済み表現を確保。

実験結果
リサーチクエスチョン
- RQ11つの統合ポリシーを、各モダリティごとに別々のモデルを必要とせずに、テキスト、音声、画像、動画の複数のタスク仕様モダリティに一般化できるように訓練できるか?
- RQ2複数のモダリティを同時に学習することで、各モダリティごとに別々のモデルを訓練する場合と比較して性能が向上するか?
- RQ3特に、スパarserなモダリティ(例:テキスト、音声)を情報量の多い動画デモの表現と一致させることで、ポリシーの一般化性能と耐性がどの程度向上するか?
- RQ4マスクされたり不完全な仕様が含まれる、複数のモダリティの組み合わせが与えられた場合、モデルの性能はいかがなっているか?
- RQ5提案された2段階の訓練手順(マスク化モデリング+クロスモーダルマッチング)は、単一目的の訓練に比べて、より優れた表現学習と下流のポリシー性能をもたらすか?
主な発見
- Mutexは、シミュレーションおよび現実世界の両環境で、6つのタスク仕様モダリティ(テキストゴール、テキスト指示、画像ゴール、動画デモ、音声ゴール、音声指示)において、すべてのモダリティ特化型ベースラインを上回る性能を発揮した。
- シミュレーション環境では、動画デモで66%の成功率、画像ゴールで61%の成功率を達成し、1つの統合モデルであるにもかかわらず、最良のモダリティ特化型ベースライン(例:動画で67%、画像ゴールで62%)を上回った。
- 現実世界のタスクでは、動画デモで50%の成功率、テキスト指示で46%の成功率を達成し、すべてのモダリティで最良のモダリティ特化型ベースライン(例:テキスト指示で47%)を上回った。
- アブレーションスタディの結果、マスク化モデリングまたはクロスモーダルマッチングのいずれかを除去すると、顕著な性能低下が生じ、2段階訓練プロセスにおける両者の重要性が確認された。
- 未知のモダリティの組み合わせに対しても、効果的に一般化でき、モダリティタイプをまたいで強力なゼロショット転送性能を示した。
- モデルサイズのアブレーションにより、性能向上はモデル容量ではなくマルチモーダル訓練に起因することが確認され、S、M、Lの3つのサイズでテストされた全範囲で、最もパフォーマンスの高かったモダリティ特化型モデルを常に上回った。
![Figure 2: Mutex ’s Model Architecture and Training Losses . Task specifications in each modality are encoded with pretrained modality-specific encoders, CLIP, and Whisper models [ 15 , 57 ] . During the first stage of training, one or more of these modalities are randomly selected and masked before](https://ar5iv.labs.arxiv.org/html/2309.14320/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。