Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Instruction-Trajectory Learning for Vision-Language Navigation

Xiwen Liang, Fengda Zhu|arXiv (Cornell University)|Dec 8, 2021
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本稿では、指示-トラジェクトリ対の間で表現学習を向上させるために粗粒度および細粒度の対照学習を活用する、新しいフレームワークである対照的インstructio-トラジェクトリ学習(CITL)を提案する。対照学習における難易度の高いネガティブサンプルを抽出し、データバイアスを軽減するためのペairwiseサンプル再重み付け機構を統合することで、R2R、R4R、RxRベンチマークにおいて最先端の性能を達成し、一般化性能およびロバストネスの面で従来手法を上回る。

ABSTRACT

The vision-language navigation (VLN) task requires an agent to reach a target with the guidance of natural language instruction. Previous works learn to navigate step-by-step following an instruction. However, these works may fail to discriminate the similarities and discrepancies across instruction-trajectory pairs and ignore the temporal continuity of sub-instructions. These problems hinder agents from learning distinctive vision-and-language representations, harming the robustness and generalizability of the navigation policy. In this paper, we propose a Contrastive Instruction-Trajectory Learning (CITL) framework that explores invariance across similar data samples and variance across different ones to learn distinctive representations for robust navigation. Specifically, we propose: (1) a coarse-grained contrastive learning objective to enhance vision-and-language representations by contrasting semantics of full trajectory observations and instructions, respectively; (2) a fine-grained contrastive learning objective to perceive instructions by leveraging the temporal information of the sub-instructions; (3) a pairwise sample-reweighting mechanism for contrastive learning to mine hard samples and hence mitigate the influence of data sampling bias in contrastive learning. Our CITL can be easily integrated with VLN backbones to form a new learning paradigm and achieve better generalizability in unseen environments. Extensive experiments show that the model with CITL surpasses the previous state-of-the-art methods on R2R, R4R, and RxR.

研究の動機と目的

  • 既存のビジョン・ランゲージナビゲーション(VLN)手法が、指示-トラジェクトリ対間の類似性と相違点を適切に区別できないという限界を解消すること。
  • サブインストラクションの時間的連続性を明示的にモデリングすることで表現学習を向上させること、これは従来のアプローチでしばしば無視されている。
  • 新しいペアワイズサンプル再重み付け機構を用いて、対照学習における容易なサンプルによる勾配主導とデータサンプリングバイアスを軽減すること。
  • 未知の環境におけるナビゲーションポリシーの一般化およびロバストネスを向上させるために、不変かつ判別性の高いビジョンおよび言語表現を学習すること。

提案手法

  • 正例、内部ネガティブ、外部ネガティブペアを含む、全トラジェクトリおよび全指示埋め込みを対比する粗粒度の対照学習目的関数を導入する。
  • 指示およびトラジェクトリにデータ拡張を適用して正例を生成する一方、最適でないおよび逸脱したトラジェクトリを内部ネガティブサンプルとして使用する。
  • 隣接するサブインストラクションを正例、非隣接のものをネガティブとみなすことで、サブインストラクション間の時間的関係をモデリングする細粒度の対照学習目的関数を提案する。
  • 難易度の高い正例およびネガティブサンプルを動的に再重み付けすることで、ノイズを低減し、学習の安定性を向上させるペアワイズサンプル再重み付け機構を統合する。
  • ペアマイニングを用いたマルチペア対照損失を採用し、学習を困難なサンプルに集中させることで、容易なネガティブサンプルによる性能飽和を回避する。
  • 既存のVLNバックボーンとCITLフレームワークを統合し、アーキテクチャの大幅な見直しを伴わずに一般化性能を向上させる、即挿し可能な学習パラダイムを構築する。

実験結果

リサーチクエスチョン

  • RQ1全指示-トラジェクトリペア間での対照学習は、ビジョン・ランゲージナビゲーションポリシーのロバストネスおよび一般化性能を向上させ得るか?
  • RQ2指示を単一のユニットとして扱うのではなく、サブインストラクションの時間的連続性をモデリングすることで、ナビゲーション性能はどのように向上するか?
  • RQ3難易度の高いサンプル抽出および再重み付けは、データバイアスを軽減し、対照VLN学習の収束を改善する程度はどの程度か?
  • RQ4粗粒度および細粒度の対照的目的関数を組み合わせることで、表現学習およびナビゲーション成功確率に相乗効果が得られるか?
  • RQ5提案されたフレームワークは、アーキテクチャの変更なしに未知の環境に効果的に一般化可能か?

主な発見

  • CITLフルフレームワークは、R2Rの検証用未学習スプリットで55.83%のSPLを達成し、ベースラインを2.93ポイント上回った。
  • 粗粒度の対照損失のみを用いることで、SPLは52.90%から55.47%に向上し、インスタンス間対照学習の有効性が示された。
  • 細粒度の対照損失は独立して用いられても顕著な寄与を示し、SPLは52.90%から55.17%に向上した。
  • ペアワイズサンプル再重み付け機構を用いることで、SPLは52.62%から55.47%に向上し、データバイアスおよびノイズ低減の有効性が裏付けられた。
  • アブレーションスタディの結果、3つのコンポーネント(粗粒度、細粒度、再重み付け)を併用した場合が最良の一般化性能を示し、R2Rで62.11%の成功率および12.36%の訓練損失を達成した。
  • 複数のベンチマークにわたる一般化性能が高く、R2R、R4R、RxRで最先端の結果を達成しており、強力なロバストネスと転送可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。