Skip to main content
QUICK REVIEW

[논문 리뷰] Transferable Representation Learning in Vision-and-Language Navigation

Haoshuo Huang, Vihan Jain|arXiv (Cornell University)|2019. 08. 09.
Multimodal Machine Learning Applications참고 문헌 46인용 수 5
한 줄 요약

이 논문은 자기지도 학습을 통한 음성-언어 간섭 없이 시각-언어 탐색(VLN)을 위한 이식 가능한 표현 학습 프레임워크를 제안한다. 이는 시각 및 언어 인코더를 두 가지 보조 과제인 교차 모odal 정렬(CMA)과 다음 시각적 풍경(NVS)에 대해 사전 훈련함으로써 달성된다. 이 도메인 적응 표현은 탐색 성능을 크게 향상시키며, RCM 에이전트는 이전 최고 성능 모델 대비 SPL에서 5%의 절대적 향상을 달성한다.

ABSTRACT

Vision-and-Language Navigation (VLN) tasks such as Room-to-Room (R2R) require machine agents to interpret natural language instructions and learn to act in visually realistic environments to achieve navigation goals. The overall task requires competence in several perception problems: successful agents combine spatio-temporal, vision and language understanding to produce appropriate action sequences. Our approach adapts pre-trained vision and language representations to relevant in-domain tasks making them more effective for VLN. Specifically, the representations are adapted to solve both a cross-modal sequence alignment and sequence coherence task. In the sequence alignment task, the model determines whether an instruction corresponds to a sequence of visual frames. In the sequence coherence task, the model determines whether the perceptual sequences are predictive sequentially in the instruction-conditioned latent space. By transferring the domain-adapted representations, we improve competitive agents in R2R as measured by the success rate weighted by path length (SPL) metric.

연구 동기 및 목표

  • 사전 훈련된 시각 및 언어 모델과 실세계 3D 환경에서의 하류 VLN 작업 간의 도메인 이동 문제를 해결하기 위해.
  • 비용이 많이 드는 인간이 주석을付け한 지시-경로 쌍에 의존도를 줄이기 위해 고품질의 자기지도 보조 과제를 만드는 것.
  • 사전 훈련된 표현을 도메인 내 VLN 분포에 적응시켜 탐색 에이전트의 일반화 능력과 성공률을 향상시키기 위해.
  • Speaker-Follower 및 강화된 교차 모달(RCM)과 같은 에이전트의 더 나은 초기화를 가능하게 하여, 본문 및 미리 보지 않은 환경 모두에서 성능을 향상시키기 위해.

제안 방법

  • 교차 모달 정렬(CMA)과 다음 시각적 풍경(NVS) 예측이라는 두 가지 보조 과제에서 시각 및 언어 인코더를 함께 사전 훈련한다.
  • 대조 학습과 음성 마이닝을 사용하여 NVS 과제를 훈련함으로써, 지시 조건에 따라 잠재 공간에서 미래의 시각적 특징을 예측한다.
  • 지시가 주어진 시각 프레임 시퀀스와 일치하는지 판단하기 위해, 교차 어텐션 기반 유사도 점수를 사용하여 CMA 과제를 훈련한다.
  • 두 과제의 손실을 가중치 합으로 조합하여 최적화한다: αℒ_alignment + (1−α)ℒ_coherence, 공동 표현 학습을 위해 최적화한다.
  • 하류 탐색 에이전트인 RCM 및 Speaker-Follower와 같은 에이전트에 대해, 미세조정된 시각 및 언어 인코더를 특징 추출기로 이식한다.
  • 적응된 표현을 활용하여 애니메이션 학습 및 다중 보상 강화 학습을 통한 에이전트 정책 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1자기지도 보조 과제가 사전 훈련된 시각 및 언어 표현의 이식 가능성을 시각-언어 탐색에 어떻게 향상시킬 수 있는가?
  • RQ2CMA와 NVS에 대한 공동 사전 훈련이 각각의 과제에 대해 별도로 사전 훈련하는 것과 비교해 하류 탐색 성능에서 어떻게 다른가?
  • RQ3도메인 적응 표현은 VLN에서 본 적 없는 환경에서의 일반화 능력을 어느 정도 향상시키는가?
  • RQ4학습된 표현은 RCM 및 Speaker-Follower와 같은 기존 최고 성능 에이전트의 성능을 향상시킬 수 있는가?
  • RQ5보조 과제에 음성 마이닝을 사용하면 인간 주석이 필요 없이 효과적인 데이터 증강이 가능한가?

주요 결과

  • CMA와 NVS에 모두 사전 훈련된 표현으로 초기화된 RCM 에이전트는 이전 최고 성능 모델 대비 SPL에서 5%의 절대적 향상을 달성했다.
  • CMA와 NVS에 대한 공동 사전 훈련은 본문 및 본 적 없는 R2R 검증 분할 모두에서 성공률(SR)을 11~12% 향상시켰으며, 무작위 또는 단일 과제 초기화보다 우수했다.
  • NVS만 사전 훈련한 경우 성능이 저하되어, 효과적인 탐색 표현 학습을 위해 교차 모달 정렬이 필수적임을 시사했다.
  • 시각 및 언어 인코더를 모두 도메인 적응 표현으로 예열한 결과, 본 적 없는 세트에서 최고의 SPL(7% 이상 향상)을 기록하여 상호 보완적 이점이 있음을 입증했다.
  • 제거 분석 결과 CMA와 NVS는 상호 보완적인 표현을 학습함을 확인했다: CMA는 교차 모달 정렬을 향상시키고, NVS는 시각적 시퀀스 모델링을 향상시켰다.
  • CMA와 NVS에 기반한 점수 모델은 장지시-경로 시퀀스의 자동 분할도 가능하게 하여, 커리큘럼 학습 잠재력이 있음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.