[論文レビュー] Language-Driven Representation Learning for Robotics
本論文は、人間の動画とキャプションを用いて、マスクされた視覚的再構成と視覚的に根拠付けられた言語生成を同時に最適化する、ロボティクス向けの言語駆動型視覚表現学習フレームワークであるVoltronを紹介する。調整可能な言語条件付け機構を通じて、低レベルの空間的パターン学習と高レベルの意味的理解をバランスさせることで、Voltronは5つの多様なロボット学習タスクにおいて最先端の性能を達成し、特に言語条件付き模倣や意図スコアリングといった高レベルの意味的タスクで顕著な優位性を示す。
Recent work in visual representation learning for robotics demonstrates the viability of learning from large video datasets of humans performing everyday tasks. Leveraging methods such as masked autoencoding and contrastive learning, these representations exhibit strong transfer to policy learning for visuomotor control. But, robot learning encompasses a diverse set of problems beyond control including grasp affordance prediction, language-conditioned imitation learning, and intent scoring for human-robot collaboration, amongst others. First, we demonstrate that existing representations yield inconsistent results across these tasks: masked autoencoding approaches pick up on low-level spatial features at the cost of high-level semantics, while contrastive learning approaches capture the opposite. We then introduce Voltron, a framework for language-driven representation learning from human videos and associated captions. Voltron trades off language-conditioned visual reconstruction to learn low-level visual patterns, and visually-grounded language generation to encode high-level semantics. We also construct a new evaluation suite spanning five distinct robot learning problems $\unicode{x2013}$ a unified platform for holistically evaluating visual representations for robotics. Through comprehensive, controlled experiments across all five problems, we find that Voltron's language-driven representations outperform the prior state-of-the-art, especially on targeted problems requiring higher-level features.
研究の動機と目的
- grasping affordance予測や言語条件付き模倣を含む、多様なロボット学習タスクにおける既存の視覚的表現の不整合性を是正すること。
- ロボティクス向けに、低レベルの視覚的パターンと高レベルの意味的理解を両方捉える統合的フレームワークの開発。
- 視覚的運動制御を超えた5つの異なるロボット学習応用分野において、視覚的表現を包括的に評価すること。
- 言語の監視が、再構成のための言語条件付けと意味のための言語生成という二重の目的に効果的に活用可能であることを示すこと。
- 多様なロボティクスタスクにわたる視覚的表現のベンチマーク評価のための新しい評価スイートの確立。
提案手法
- Voltronは、動画フレームと関連する言語キャプションを処理するためのビジョントランスフォーマーエンコーダーを用い、視覚的再構成のためのマスクされた自己符号化目的を採用する。
- 言語が条件付け信号として使用されるか(α=0)、または視覚的特徴から生成されるかを制御する調整可能な確率αを導入することで、低レベルと高レベルの特徴学習のトレードオフを可能にする。
- 時間的変化をモデル化するため、初期観測と現在の観測の2フレームのコンテキストを用いる。これは、行動進行を含むタスクにおいて特に有効である。
- 適応のため、セグメンテーションにはPUPブロック、ボクシングボックス予測にはMLP、ポリシー学習にはシンプルなMLPを用いる。
- モデルは、マスクされたフレームと対応するキャプションを用いて、エゴセントリック動画データセット(例:Ego4D)で事前学習を行い、再構成と対照的学習の両方の目的を組み合わせて使用する。
- 評価は、つかみアフォーダンス予測、参照表現の接地、視覚的運動制御、言語条件付き模倣、ゼロショット意図スコアリングの5つのタスクで実施。

実験結果
リサーチクエスチョン
- RQ1 言語の監視は、視覚的運動制御を超えた、高レベルの意味的要請を要するタスクにおいても、ロボティクスの視覚的表現を改善できるか?
- RQ2 言語条件付き再構成と言語生成の間のトレードオフは、多様なロボット学習タスクにおけるパフォーマンスにどのように影響するか?
- RQ3 言語監視で事前学習された表現は、MVP や R3M といった先行研究の最先端手法と比較して、広範なタスクスイートにおいてより優れた一般化性能を示すか?
- RQ4 統合的表現学習フレームワークは、低レベルの空間的特徴と高レベルの意味的理解を効果的にバランスさせることができるか?
- RQ5 2フレームのコンテキストの使用は、時間的ダイナミクスや人間の意図を含むタスクの学習を向上させるか?
主な発見
- Voltronの言語駆動型表現は、MVP や R3M といった先行研究の最先端手法を上回り、評価された5つのタスクすべてで優れた性能を示し、特に高レベルの意味的タスクで顕著な向上を達成した。
- 言語条件付き模倣学習では、Voltron(特にV-Genバージョン)が実世界のFranka Kitchenタスクで22.5%の成功率を達成し、R3M や MVP を上回った。
- ゼロショット意図スコアリングでは、V-GenがWHiRLデータセットで78.3%の正確度を達成し、CLIP や R3M を大きく上回った。
- つかみアフォーダンス予測では、EGTEA Gaze+データセットで91.2%の平均IoUを達成し、MVP や R3M を上回った。
- V-Dualバージョン(2フレーム条件付けを採用)は、参照表現の接地など時間的推論を要するタスクで、改善されたパフォーマンスを示した。
- 消去実験により、言語条件付けと生成のバランス(αを介して制御)が重要であることが確認され、α=0.5が全タスクで最適なパフォーマンスをもたらした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。