[論文レビュー] HOP: History-and-Order Aware Pre-training for Vision-and-Language Navigation
本稿では、行動予測と履歴、トラジェクトリの順序モデリング(TOM)、グループの順序モデリング(GOM)、および標準的なプロキシタスクを統合することで、空間的・時間的視覚的・言語的理解を強化する、ビジョンアンドランゲージナビゲーション(VLN)のための履歴および順序に配慮した事前学習フレームワークHOPを提案する。この手法は、R2Rで63.86%のSPL、NDHで4.37%の成功率を達成するなど、4つのVLNベンチマークで最先端の性能を示し、事前学習段階での履歴的文脈と時間的順序のモデリングの有効性を実証している。
Pre-training has been adopted in a few of recent works for Vision-and-Language Navigation (VLN). However, previous pre-training methods for VLN either lack the ability to predict future actions or ignore the trajectory contexts, which are essential for a greedy navigation process. In this work, to promote the learning of spatio-temporal visual-textual correspondence as well as the agent's capability of decision making, we propose a novel history-and-order aware pre-training paradigm (HOP) with VLN-specific objectives that exploit the past observations and support future action prediction. Specifically, in addition to the commonly used Masked Language Modeling (MLM) and Trajectory-Instruction Matching (TIM), we design two proxy tasks to model temporal order information: Trajectory Order Modeling (TOM) and Group Order Modeling (GOM). Moreover, our navigation action prediction is also enhanced by introducing the task of Action Prediction with History (APH), which takes into account the history visual perceptions. Extensive experimental results on four downstream VLN tasks (R2R, REVERIE, NDH, RxR) demonstrate the effectiveness of our proposed method compared against several state-of-the-art agents.
研究の動機と目的
- 先行するVLN事前学習手法が、指示における履歴的視覚的文脈と時間的順序を無視するという限界を是正すること。
- 事前学習段階の意思決定プロセスに過去の観測を組み込むことで、行動予測の精度を向上させること。
- 視覚的トラジェクトリと指示の時間的順序を、新たなプロキシタスクを通じて明示的にモデリングすること。
- ドメイン内(R2R)およびドメイン外(RxR、NDH、REVERIE)の多様なVLNタスクへの汎化性能を向上させること。
- 履歴に配慮したおよび順序に配慮した事前学習目的を組み合わせることで、個々のコンponentsを上回る下流性能が得られることを実証すること。
提案手法
- 現在の観測に加えて過去の視覚的観測を用いて、次のナビゲーション行動を予測する「行動予測と履歴(APH)」を導入する。
- シャッフルされた視覚的トラジェクトリフレームの正しい順序を再構築することを要請するタスクとして「トラジェクトリの順序モデリング(TOM)」を提案する。
- 指示から導出された2つの部分的トラジェクトリの正しい順序を予測させる「グループの順序モデリング(GOM)」を導入する。
- これらの新規タスクを、マスクド言語モデリング(MLM)とトラジェクトリ-指示マッチング(TIM)という標準的な事前学習目的と組み合わせる。
- 一般化を向上させるために、PREVALENTおよびBnB*-処理済みデータを含む多様なデータセットでモデルを事前学習する。
- 4つの下流VLNタスク(R2R、RxR、NDH、REVERIE)で、事前学習済みモデルを微調整する。
実験結果
リサーチクエスチョン
- RQ1事前学習段階で行動予測に履歴的視覚的観測を組み込むことで、ナビゲーション性能が向上するか?
- RQ2細分化されたトラジェクトリの順序(TOM)と粗粒度のグループ順序(GOM)をモデリングすることで、VLNにおける時間的推論が向上するか?
- RQ3提案されたプロキシタスク(APH、TOM、GOM)は、MLM や TIM といった標準的な事前学習目的と比べて、どの程度効果的か?
- RQ4BnB* を含む多様なデータで事前学習することで、REVERIE のようなドメイン外VLNタスクでの性能がどの程度向上するか?
- RQ5履歴に配慮したおよび順序に配慮した事前学習目的の組み合わせは、相乗効果をもたらし、個々のコンponentsを上回る性能向上をもたらすか?
主な発見
- HOP事前学習フレームワークは、R2Rベンチマークで63.86%のSPLを達成し、事前学習なしのベースラインと比較して成功率が9%向上した。
- RxRタスクでは、0.33 sDTWを達成し、長く複雑な指示処理において優れた性能を示した。
- NDHタスクでは、平均パス長が3.84メートルに達し、追加のBnB*データで事前学習した場合、1メートルの改善が得られた。
- REVERIEタスクでは、24.34%のSPLと14.34%のRGSPLを達成し、BnB*-処理済みデータで事前学習した場合、成功率が6%も向上した。
- アブレーションスタディの結果、APHが性能向上に最も寄与しており、次にTOM、GOM、TIMの順に寄与度が高く、すべてのタスクが補完的改善を示した。
- アブレーションスタディでは、すべての事前学習タスク(MLM、TIM、TOM、GOM、APH)を組み合わせた場合が最高の性能を示し、NDHで4.37%の成功率を達成し、個々のタスクのみを用いたモデルを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。