[논문 리뷰] Contrastive Instruction-Trajectory Learning for Vision-Language Navigation
이 논문은 시각-언어 탐색을 향상시키기 위해 지시어-경로 쌍 간의 근본적이고 세밀한 대비 학습을 활용하는 새로운 프레임워크인 대비 지시어-경로 학습(CITL)을 제안한다. 쌍별 샘플 재가중 기법을 통해 어려운 음성 샘플을 탐색하고 데이터 편향을 완화함으로써, R2R, R4R, RxR 벤치마크에서 최신 기술 수준의 성능을 달성하며 일반화 능력과 견고성에서 이전 방법들을 능가한다.
The vision-language navigation (VLN) task requires an agent to reach a target with the guidance of natural language instruction. Previous works learn to navigate step-by-step following an instruction. However, these works may fail to discriminate the similarities and discrepancies across instruction-trajectory pairs and ignore the temporal continuity of sub-instructions. These problems hinder agents from learning distinctive vision-and-language representations, harming the robustness and generalizability of the navigation policy. In this paper, we propose a Contrastive Instruction-Trajectory Learning (CITL) framework that explores invariance across similar data samples and variance across different ones to learn distinctive representations for robust navigation. Specifically, we propose: (1) a coarse-grained contrastive learning objective to enhance vision-and-language representations by contrasting semantics of full trajectory observations and instructions, respectively; (2) a fine-grained contrastive learning objective to perceive instructions by leveraging the temporal information of the sub-instructions; (3) a pairwise sample-reweighting mechanism for contrastive learning to mine hard samples and hence mitigate the influence of data sampling bias in contrastive learning. Our CITL can be easily integrated with VLN backbones to form a new learning paradigm and achieve better generalizability in unseen environments. Extensive experiments show that the model with CITL surpasses the previous state-of-the-art methods on R2R, R4R, and RxR.
연구 동기 및 목표
- 기존의 시각-언어 탐색(VLN) 방법들이 지시어-경로 쌍 간의 유사성과 차이점을 구분하지 못하는 한계를 해결하기 위해.
- 일반적으로 이전 접근법에서 간과되는 부분 지시어의 시간 연속성을 명시적으로 모델링하여 표현 학습을 향상시키기 위해.
- 새로운 쌍별 샘플 재가중 기법을 통해 대비 학습에서 쉬운 샘플의 데이터 샘플링 편향과 기울기 지배 문제를 완화하기 위해.
- 비교적 새로운 환경에서의 탐색 정책의 일반화 능력과 견고성을 향상시키기 위해, 불변성과 분류 능력을 갖춘 시각 및 언어 표현을 학습하기 위해.
제안 방법
- 전체 경로와 지시어 임베딩 간의 대비를 통해 양성, 내부 음성, 외부 음성 쌍을 대비하는 근본적인 대비 학습 목표를 도입한다.
- 지시어와 경로에 대한 데이터 증강을 활용해 양성 샘플을 생성하며, 열악한 최적화된 경로와 이질적인 경로는 내부 음성 샘플로 활용한다.
- 부분 지시어 간의 시간적 관계를 모델링하는 세밀한 대비 학습 목표를 제안하며, 인접한 부분 지시어를 양성으로, 비인접한 부분 지시어를 음성으로 간주한다.
- 어려운 양성 및 음성 샘플을 동적으로 재가중하여 노이즈를 감소시키고 학습 안정성을 향상시키는 쌍별 샘플 재가중 기법을 통합한다.
- 쌍 추출을 통한 다중 쌍 대비 손실을 사용하여 어려운 샘플에 집중함으로써, 쉬운 음성 샘플로 인한 성능 포화를 방지한다.
- 기존의 VLN 백본과 CITL 프레임워크를 통합하여 아키텍처 수정 없이도 일반화 능력을 향상시킬 수 있는 플러그 앤 플레이 학습 파라다임을 구현한다.
실험 결과
연구 질문
- RQ1전체 지시어-경로 쌍 간의 대비 학습이 시각-언어 탐색 정책의 견고성과 일반화 능력을 향상시키는가?
- RQ2지시어를 단일 단위로 취급하는 것과 비교해 부분 지시어의 시간 연속성을 모델링하면 탐색 성능가 어떻게 향상되는가?
- RQ3어려운 샘플 탐색과 재가중 기법이 데이터 편향을 얼마나 줄이고 대비 VLN 학습의 수렴을 향상시키는가?
- RQ4근본적이고 세밀한 대비 목표를 결합하면 표현 학습과 탐색 성공률에서 상호보완적인 향상이 이루어지는가?
- RQ5제안된 프레임워크는 아키텍처 수정 없이도 새로운 환경에 효과적으로 일반화되는가?
주요 결과
- 전체 CITL 프레임워크는 R2R 검증-신규 환경 분할에서 55.83%의 SPL을 달성하여 기준 모델보다 2.93%포인트 높게 기록했다.
- 근본적인 대비 손실만으로도 성능이 52.90%에서 55.47%로 향상되어, 인스턴스 간 대비 학습의 가치를 입증했다.
- 세밀한 대비 손실은 독립적으로 사용되었을 때도 기여가 크며, SPL을 52.90%에서 55.17%로 향상시켰다.
- 쌍별 샘플 재가중 기법은 성능을 52.62%에서 55.47%로 향상시켜 데이터 편향과 노이즈 완화의 효과를 확인했다.
- 절단 실험 결과, 세 가지 구성 요소(근본, 세밀, 재가중)를 모두 조합했을 때 가장 우수한 일반화 성능을 기록했으며, R2R에서 62.11%의 성공률과 12.36%의 훈련 손실을 기록했다.
- 모델은 다양한 벤치마크에서 잘 일반화되며, R2R, R4R, RxR에서 최신 기술 수준의 결과를 기록하여 강력한 견고성과 이식 가능성(전이 가능성)을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.