[論文レビュー] Transferable Representation Learning in Vision-and-Language Navigation
本論文は、自己教師付きネガティブマイニングを用いて、2つの補助タスク—クロスモodalアライメント(CMA)と次なる視覚的シーン(NVS)—でビジョンと言語エンコーダーを事前学習することで、ビジョンアンドランゲージナビゲーション(VLN)の転送可能な表現学習フレームワークを提案する。ドメイン適応表現はナビゲーション性能を顕著に向上させ、RCMエージェントは先行する最先端モデルと比較してSPLで5%の絶対的向上を達成した。
Vision-and-Language Navigation (VLN) tasks such as Room-to-Room (R2R) require machine agents to interpret natural language instructions and learn to act in visually realistic environments to achieve navigation goals. The overall task requires competence in several perception problems: successful agents combine spatio-temporal, vision and language understanding to produce appropriate action sequences. Our approach adapts pre-trained vision and language representations to relevant in-domain tasks making them more effective for VLN. Specifically, the representations are adapted to solve both a cross-modal sequence alignment and sequence coherence task. In the sequence alignment task, the model determines whether an instruction corresponds to a sequence of visual frames. In the sequence coherence task, the model determines whether the perceptual sequences are predictive sequentially in the instruction-conditioned latent space. By transferring the domain-adapted representations, we improve competitive agents in R2R as measured by the success rate weighted by path length (SPL) metric.
研究の動機と目的
- 事前学習済みビジョンと言語モデルと、現実の3次元環境におけるダウンストリームVLNタスクとの間のドメインシフトを解消すること。
- 高品質な自己教師付き補助タスクを構築することで、高価な人手による指針-パスペアの依存度を低下させること。
- 事前学習済み表現をドメイン内VLN分布に適応させることで、ナビゲーションエージェントの一般化性能と成功確率を向上させること。
- Speaker-Follower や強化されたクロスモーダル(RCM)のようなエージェントのためのより良い初期化を可能にし、見慣れない環境を含め、両方の環境で性能を向上させること。
提案手法
- ビジョンと言語エンコーダーを、クロスモダリティアライメント(CMA)と次なる視覚的シーン(NVS)予測の2つの補助タスクで同時に事前学習する。
- 対照的学習とネガティブマイニングを用いてNVSタスクを訓練し、指示に条件づけられた潜在空間内で将来の視覚的特徴を予測する。
- CMAタスクを訓練する際、クロスアテンションに基づく類似度スコアを用いて、与えられた指示が視覚フレームのシーケンスと一致するかどうかを判定する。
- 両タスクの損失を重み付き和で結合する:αℒ_alignment + (1−α)ℒ_coherence として、統合的表現学習を最適化する。
- 微調整されたビジョンおよび言語エンコーダーを、RCM や Speaker-Follower などのダウンストリームナビゲーションエージェントの特徴抽出器として転送する。
- 適応済み表現を用いて、模倣学習およびマルチリワード強化学習によるエージェントポリシー学習を向上させる。
実験結果
リサーチクエスチョン
- RQ1自己教師付き補助タスクは、事前学習済みビジョンと言語表現のVLNへの転送性を向上させることができるか?
- RQ2CMAとNVSの両方で同時事前学習する場合と、それぞれのタスク単独で事前学習する場合とを比較した場合、ダウンストリームナビゲーション性能にどのような差が生じるか?
- RQ3ドメイン適応表現は、VLNにおける未学習環境での一般化性能をどの程度向上させるか?
- RQ4学習された表現は、RCM や Speaker-Follower のような既存の最先端エージェントの性能を向上させることができるか?
- RQ5補助タスクにおけるネガティブマイニングの使用は、人手によるアノテーションを必要とせずに、効果的なデータ拡張を可能にするか?
主な発見
- CMA と NVS の両方で事前学習された表現を初期化に用いた RCM エージェントは、以前の最先端モデルと比較してSPLで5%の絶対的向上を達成した。
- CMA と NVS の両方で同時事前学習すると、見慣れたおよび見慣れないR2Rバリデーションスプリットの両方で、成功確率(SR)が11–12%向上した。これは、ランダム初期化や単一タスク初期化と比較して顕著な向上である。
- NVS のみを事前学習した場合、性能が低下した。これは、効果的なナビゲーション表現学習において、クロスモダリティのアライメントが不可欠であることを示している。
- ビジョンおよび言語エンコーダーの両方をドメイン適応表現でウォームスタートさせた場合、未学習セットで最高のSPL(7%以上向上)が達成され、相乗効果が確認された。
- アブレーションスタディにより、CMA と NVS は補完的な表現を学習することが確認された:CMA はクロスモダリティのアライメントを強化し、NVS は視覚的シーケンスモデリングを向上させる。
- CMA と NVS で訓練されたスコアリングモデルは、長時間の指針-パスシーケンスの自動セグメンテーションも可能にした。これはカリキュラム学習への応用可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。