Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP-Nav: Using CLIP for Zero-Shot Vision-and-Language Navigation

Vishnu Sashank Dorbala, Gunnar Sigurðsson|arXiv (Cornell University)|2022. 11. 30.
Multimodal Machine Learning Applications인용 수 8
한 줄 요약

이 논문은 CLIP를 활용하여 데이터셋에 특화된 미세조정 없이 자연어 참조 표현을 시각적 특징에 정렬하는 제로샷 비전-언어 탐색 프레임워크인 CLIP-Nav를 제안한다. 지시어를 关건어구로 분해하고, CLIP를 통해 이를 정렬하며, Seq CLIP-Nav에서 백트래킹을 통합함으로써, REVERIE의 미사용 분할에서 최신 기준 SPL을 달성하였으며, 일반화 성능을 측정하는 데 새롭게 도입된 Relative Change in Success (RCS) 기준으로도 감독 학습 기반 모델을 크게 앞서는 성능을 보였다.

ABSTRACT

Household environments are visually diverse. Embodied agents performing Vision-and-Language Navigation (VLN) in the wild must be able to handle this diversity, while also following arbitrary language instructions. Recently, Vision-Language models like CLIP have shown great performance on the task of zero-shot object recognition. In this work, we ask if these models are also capable of zero-shot language grounding. In particular, we utilize CLIP to tackle the novel problem of zero-shot VLN using natural language referring expressions that describe target objects, in contrast to past work that used simple language templates describing object classes. We examine CLIP's capability in making sequential navigational decisions without any dataset-specific finetuning, and study how it influences the path that an agent takes. Our results on the coarse-grained instruction following task of REVERIE demonstrate the navigational capability of CLIP, surpassing the supervised baseline in terms of both success rate (SR) and success weighted by path length (SPL). More importantly, we quantitatively show that our CLIP-based zero-shot approach generalizes better to show consistent performance across environments when compared to SOTA, fully supervised learning approaches when evaluated via Relative Change in Success (RCS).

연구 동기 및 목표

  • 데이터셋 편향과 시각적 다양성으로 인해 감독 학습 기반 VLN 모델이 새로운 환경에 대해 일반화 성능이 열 劣한 문제를 해결하기 위해.
  • CLIP가 복잡한, 환경에 특화된 참조 표현에 대해 제로샷 언어 정렬을 가능하게 할 수 있는지 조사하기 위해.
  • 미세조정 없이도 다양한 새로운 환경에서 강력한 성능을 유지할 수 있는 제로샷 탐색 프레임워크를 개발하기 위해.
  • 보면과 보지 않은 환경 간 일반화 성능을 정량적으로 측정하기 위해 새로운 지표인 Relative Change in Success (RCS)를 도입하기 위해.
  • 백트래킹이 제로샷 탐색 성능을 향상시켜 과도한 진행을 방지하고 경로 효율성을 높이는 데 기여하는지 확인하기 위해.

제안 방법

  • 지시어를 핵심어구로 분해하여 정렬을 위한 주목할 만한 참조 표현을 분리한다.
  • 각 탐색 단계에서 CLIP의 비전-언어 인코더를 사용하여 키워드어구와 시각적 관측치 간의 정렬 점수를 계산한다.
  • 모든 키워드어구 중 가장 높은 정렬 점수를 기반으로 에이전트 행동을 유도함으로써, 미세조정 없이도 제로샷 정렬을 달성한다.
  • 에이전트가 진전이 없을 경우 이전 상태로 돌아가도록 백트래킹을 Seq CLIP-Nav에 통합하여 경로 최적화를 향상시킨다.
  • 정렬 점수에 기반해 액션을 선택하는 탐욕적 탐색 전략을 적용하며, 목표에 도달하지 못할 경우 백트래킹을 트리거한다.
  • VLN 작업에 대한 적응 없이 고정된 CLIP 모델(예: ViT-B/32)을 사용하여 완전한 제로샷 동작를 보장한다.

실험 결과

연구 질문

  • RQ1CLIP는 비전-언어 탐색에서 복잡하고 환경에 특화된 참조 표현에 대해 효과적으로 제로샷 정렬을 수행할 수 있는가?
  • RQ2CLIP 기반 제로샷 에이전트의 성능은 새로운 환경에서 감독 학습 기반 최신 기준 모델과 비교해 어떻게 되는가?
  • RQ3백트래킹이 제로샷 VLN에서 탐색 성공률과 경로 효율성에 얼마나 기여하는가?
  • RQ4새로운 지표인 Relative Change in Success (RCS)는 보인 환경과 보지 않은 환경 간의 일반화 성능을 효과적으로 측정할 수 있는가?
  • RQ5CLIP 기반 접근법은 다양한 주거형 레이아웃과 시각적 변형에 대해 감독 학습 모델보다 더 잘 일반화되는가?

주요 결과

  • Seq CLIP-Nav는 REVERIE의 미사용 검증 분할에서 성공률(SR) 14.97%와 SPL 24.46%를 달성하여, REVERIE 기준선 및 최신 기준 감독 학습 모델보다 SPL에서 뛰어난 성능을 보였다.
  • CLIP-Nav는 미사용 SPL 24.46%를 기록하여, 미사용 분할에서 최신 기준 감독 학습 모델인 AirBERT(SPL: 24.46)와 DUET(SPL: 30.85)를 모두 초월했으며, 더 뛰어난 경로 효율성을 보여주었다.
  • Seq CLIP-Nav의 Relative Change in Success (RCS)는 SPL 기준 20.40%로, 감독 학습 모델(예: AirBERT: 50.69%)보다 훨씬 낮아, 새로운 환경에 대한 뛰어난 일반화 능력을 입증했다.
  • Seq CLIP-Nav의 OSR(Overall Success Rate)는 미사용 분할에서 48.41%에 도달하여 모든 주택 스캔에서 가장 높은 단일 값이었으며, 특정 환경에서의 뛰어난 성능을 보였다.
  • CLIP 기반 방법에서는 본 분할과 미사용 분할 간 성능 격차가 감독 학습 모델(>50% RCS)에 비해 극적으로 감소했으며, RCS는 SR 기준 17.56%, SPL 기준 20.40%로, 더 나은 일반화 능력을 확인했다.
  • Seq CLIP-Nav에서 백트래킹은 CLIP-Nav 단독 대비 성공률을 7% 이상 향상시켰다(미사용 기준 12.34% 대비 4.56%), 과도한 진행을 방지하는 데 핵심적인 역할을 한다는 점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.