Skip to main content
QUICK REVIEW

[논문 리뷰] HOP: History-and-Order Aware Pre-training for Vision-and-Language Navigation

Yanyuan Qiao, Yuankai Qi|arXiv (Cornell University)|2022. 03. 22.
Multimodal Machine Learning Applications인용 수 8
한 줄 요약

이 논문은 시각-언어 탐색(VLN)을 위한 역사 및 순서 인지 사전 훈련 프레임워크인 HOP를 제안한다. HOP는 행동 예측, 이력 모델링, 궤적 순서 모델링(TOM), 그룹 순서 모델링(GOM), 그리고 표준 프록시 작업을 통합하여 시공간적 시각-언어 이해를 향상시킨다. 이 방법은 R2R에서 63.86% SPL, NDH에서 4.37% 성공률을 기록하며 네 가지 VLN 벤치마크에서 최고 성능을 달성하여 사전 훈련 시 역사적 맥락과 시간적 순서를 모델링하는 것이 효과적임을 입증한다.

ABSTRACT

Pre-training has been adopted in a few of recent works for Vision-and-Language Navigation (VLN). However, previous pre-training methods for VLN either lack the ability to predict future actions or ignore the trajectory contexts, which are essential for a greedy navigation process. In this work, to promote the learning of spatio-temporal visual-textual correspondence as well as the agent's capability of decision making, we propose a novel history-and-order aware pre-training paradigm (HOP) with VLN-specific objectives that exploit the past observations and support future action prediction. Specifically, in addition to the commonly used Masked Language Modeling (MLM) and Trajectory-Instruction Matching (TIM), we design two proxy tasks to model temporal order information: Trajectory Order Modeling (TOM) and Group Order Modeling (GOM). Moreover, our navigation action prediction is also enhanced by introducing the task of Action Prediction with History (APH), which takes into account the history visual perceptions. Extensive experimental results on four downstream VLN tasks (R2R, REVERIE, NDH, RxR) demonstrate the effectiveness of our proposed method compared against several state-of-the-art agents.

연구 동기 및 목표

  • 이전 VLN 사전 훈련 방법이 지시문 내 역사적 시각적 맥락과 시간적 순서를 간과하는 한계를 해결하기 위해.
  • 사전 훈련 중 의사결정 과정에 과거 관측값을 통합하여 행동 예측 정확도를 향상시키기 위해.
  • 새로운 프록시 작업을 통해 시각 궤적과 지시문의 시간적 순서를 명시적으로 모델링하기 위해.
  • 도메인 내(R2R) 및 도메인 외(RxR, NDH, REVERIE) 설정을 포함한 다양한 VLN 작업 간 일반화 능력을 향상시키기 위해.
  • 역사 인지 및 순서 인지 사전 훈련 목표를 조합할 경우 개별 구성 요소를 초월한 성능 향상이 이루어지는지 입증하기 위해.

제안 방법

  • 현재 및 과거 시각 관측값을 모두 사용하여 다음 탐색 행동을 예측하는 '행동 예측과 이력(APH)'을 도입한다.
  • 혼합된 시각 궤적 프레임의 정확한 순서를 재구성하도록 요구하는 '궤적 순서 모델링(TOM)'을 제안한다.
  • 지시문에서 파생된 두 개의 부분 궤적의 정확한 순서를 예측하도록 하는 '그룹 순서 모델링(GOM)'을 도입한다.
  • 이러한 새로운 작업들을 표준 사전 훈련 목표인 마스크 언어 모델링(MLM) 및 궤적-지시문 매칭(TIM)과 결합한다.
  • 일반화 능력을 향상시키기 위해 PREVALENT 및 BnB*-가공 데이터를 포함한 다양한 데이터 세트에서 모델을 사전 훈련한다.
  • 사전 훈련된 모델을 네 가지 도메인 특화 VLN 작업(R2R, RxR, NDH, REVERIE)에서 미세 조정한다.

실험 결과

연구 질문

  • RQ1사전 훈련 중 행동 예측에 역사적 시각 관측값을 통합하면 탐색 성능이 향상되는가?
  • RQ2세부적인 궤적 순서(TOM)와 개략적인 그룹 순서(GOM)를 모델링하면 VLN에서 시간적 추론 능력이 향상되는가?
  • RQ3제안된 프록시 작업(APH, TOM, GOM)은 MLM 및 TIM과 같은 표준 사전 훈련 목표와 비교해 얼마나 효과적인가?
  • RQ4BnB* 데이터를 포함한 다양한 데이터에서 사전 훈련하면, REVERIE와 같은 도메인 외 VLN 작업에서 성능 향상이 얼마나 이루어지는가?
  • RQ5역사 인지 및 순서 인지 사전 훈련 목표의 조합이 상호 보완적 효과를 가지며 개별 구성 요소를 초월한 성능 향상을 이끌어내는가?

주요 결과

  • HOP 사전 훈련 프레임워크는 R2R 벤치마크에서 63.86% SPL을 달성하여 사전 훈련 없이 기반 모델 대비 성공률 9% 향상.
  • RxR 작업에서는 0.33 sDTW를 기록하여 장거리이고 복잡한 지시문에서도 뛰어난 성능을 입증.
  • NDH 작업에서는 평균 경로 길이 3.84미터를 기록하며, BnB*-가공 데이터로 사전 훈련한 경우 기준 모델 대비 1미터 향상.
  • REVERIE 작업에서는 24.34% SPL 및 14.34% RGSPL을 달성하였고, BnB*-가공 데이터로 사전 훈련한 경우 성공률 6% 향상.
  • 절단 분석 결과 APH가 성능 향상에 가장 기여하며, 그 다음으로 TOM, GOM, TIM 순서로 기여도가 높으며, 모든 작업이 상호 보완적인 개선 효과를 보임.
  • 절단 분석 결과, MLM, TIM, TOM, GOM, APH 모두를 조합한 사전 훈련 작업이 가장 높은 성능을 기록하여 NDH에서 4.37% 성공률 달성. 개별 작업만 사용한 모델보다 뛰어난 성능.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.