Skip to main content
QUICK REVIEW

[논문 리뷰] Are You Looking? Grounding to Multiple Modalities in Vision-and-Language Navigation

Ronghang Hu, Daniel Fried|arXiv (Cornell University)|2019. 06. 02.
Multimodal Machine Learning Applications참고 문헌 35인용 수 13
한 줄 요약

이 논문은 시각-언어 탐색(VLN)에서의 기반 설정을 조사하며, 최신 모델에서 시각적 특징이 일반화를 저해할 수 있음을 발견한다. 다중모달 기반 설정을 향상시키기 위해 저자는 시각적(ConvNets 및 객체 탐지)과 비시각적(경로 구조 전용) 에이전트를 조합한 전문가의 혼합(mixture-of-experts) 프레임워크를 제안하며, 이는 R2R 검증-미사용(split)에서 성공률을 51.9%로 끌어올려 기존 모델보다 10个百分点 이상 높였다.

ABSTRACT

Vision-and-Language Navigation (VLN) requires grounding instructions, such as "turn right and stop at the door", to routes in a visual environment. The actual grounding can connect language to the environment through multiple modalities, e.g. "stop at the door" might ground into visual objects, while "turn right" might rely only on the geometric structure of a route. We investigate where the natural language empirically grounds under two recent state-of-the-art VLN models. Surprisingly, we discover that visual features may actually hurt these models: models which only use route structure, ablating visual features, outperform their visual counterparts in unseen new environments on the benchmark Room-to-Room dataset. To better use all the available modalities, we propose to decompose the grounding procedure into a set of expert models with access to different modalities (including object detections) and ensemble them at prediction time, improving the performance of state-of-the-art models on the VLN task.

연구 동기 및 목표

  • 최신 VLN 모델에서 언어 기반 설정이 어디에서 발생하는지 조사한다—특히 성능 향상 요인이 시각적 외관, 경로 구조, 또는 둘 다인지 파악한다.
  • 현재 모델이 시각 입력에 크게 의존하고 있음에도 불구하고, 시각적 특징이 실제로 미사용 환경에서의 일반화를 향상시키는지 평가한다.
  • 낮은 수준의 CNN 특징보다 더 잘 일반화되는 고수준의 객체 기반 표현을 도입하여 다중모달 기반 설정을 향상시킨다.
  • 모odal 특화된 에이전트(시각적 및 비시각적)의 보완적 조합을 설계하여 단일 모델 기반 모델보다 우수한 성능을 내도록 한다.
  • 공유된 인코더를 공유하는 모달 특화 디코더의 공동 학습이 성능을 더욱 향상시킬 수 있음을 입증한다.

제안 방법

  • 저자는 시각적 특징 없이 학습시켜 경로 구조의 기여도를 분리하기 위해 최신 VLN 모델 두 종류(Speaker-Follower 및 Self-Monitoring)를 학습시켰다.
  • 일반화 성능을 향상시키기 위해 사전 학습된 객체 탐지기를 사용해 고수준의 객체 기반 시각적 표현을 도입했다.
  • 각각 다른 모달에 특화된 시각적 및 비시각적 에이전트를 별도로 학습시키고, 테스트 시에 예측을 융합하는 전문가의 혼합 프레임워크를 설계했다.
  • 테스트 시 융합과 함께, 단일 지시 인코더를 공유하는 다중 디코더의 공동 학습도 실험했으며, 각 디코더는 서로 다른 모달에 주목하도록 설계했다.
  • 특히 새로운 환경에서의 일반화 능력을 평가하기 위해 R2R 벤치마크, 특히 검증-미사용(split)에서 성능을 평가했다.
  • 각 모달의 영향과 그 조합의 영향을 분리하기 위해 시각적 전용, 비시각적 전용, 하이브리드 모델 등의 추론 모델을 비교했다.

실험 결과

연구 질문

  • RQ1최신 VLN 모델이 언어를 시각적 외관과 경로 구조 중 어느 쪽에 더 많이 기반으로 삼는가?
  • RQ2시각적 특징의 포함이 실제로 새로운 환경에서의 일반화를 향상시키는가, 아니면 성능 저하를 초래하는가?
  • RQ3낮은 수준의 CNN 특징에 비해 고수준의 객체 기반 표현이 시각적 기반 설정의 일반화를 향상시키는가?
  • RQ4다른 모달에 특화된 에이전트(시각적 대비 비시각적)를 조합하면 단일 모델 또는 동일 모달의 융합보다 더 우수한 성능을 낼 수 있는가?
  • RQ5공유된 인코더를 공유하는 모달 특화 디코더의 공동 학습이 별도로 학습된 에이전트의 테스트 시 융합보다 성능이 뛰어나게 되는가?

주요 결과

  • 시각적 특징이 없는 모델(비시각적 에이전트)이 R2R 검증-미사용(split)에서 시각적 모델과 유사하거나 더 높은 성공률을 기록하여, 시각적 특징이 일반화를 해칠 수 있음을 시사한다.
  • 가장 높은 성능을 낸 모델은 ResNet CNN 특징, 객체 탐지, 비시각적 경로 구조를 조합한 전문가의 혼합 모델로, R2R 검증-미사용(split)에서 51.9%의 성공률을 기록하여 기준 모델보다 10个百分点 이상 높았다.
  • 전문가의 혼합 접근법은 동일 모달의 두 에이전트 융합보다 성능이 뛰어나, 시각적 및 비시각적 에이전트가 상호 보완적인 기여를 한다는 것을 확인했다.
  • 시각적 모델에 객체 기반 표현을 추가하면 CNN 전용 시각적 모델 대비 성능이 2.6% 향상되어, 고수준의 시각적 표현이 더 잘 일반화됨을 보여준다.
  • 공유된 인코더를 공유하는 다중 디코더의 공동 학습은 별도로 학습된 에이전트의 테스트 시 융합보다 높은 성능을 내어, 공동 최적화가 모달 통합을 향상시킨다는 것을 시사한다.
  • 51.9%의 성공률은 볼 수 있는 환경(split)에서도 유지되어 기존 환경에서의 성능 저하가 없음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.