Skip to main content
QUICK REVIEW

[논문 리뷰] A Recurrent Vision-and-Language BERT for Navigation

Yicong Hong, Qi Wu|arXiv (Cornell University)|2020. 11. 26.
Multimodal Machine Learning Applications참고 문헌 59인용 수 40
한 줄 요약

이 논문은 VLN ∘→BERT를 제안한다. 이는 부분적으로 관찰 가능한 VLN 과제를 해결하기 위해 히스토리-인식 교차 모달 상태를 유지하는 순환 비전-언어 BERT로, 사전 학습된 V&L BERT를 내비게이터로 활용하고 다중 작업 능력을 가능하게 하여 R2R과 REVERIE에서 최첨단 결과를 달성한다.

ABSTRACT

Accuracy of many visiolinguistic tasks has benefited significantly from the application of vision-and-language(V&L) BERT. However, its application for the task of vision-and-language navigation (VLN) remains limited. One reason for this is the difficulty adapting the BERT architecture to the partially observable Markov decision process present in VLN, requiring history-dependent attention and decision making. In this paper we propose a recurrent BERT model that is time-aware for use in VLN. Specifically, we equip the BERT model with a recurrent function that maintains cross-modal state information for the agent. Through extensive experiments on R2R and REVERIE we demonstrate that our model can replace more complex encoder-decoder models to achieve state-of-the-art results. Moreover, our approach can be generalised to other transformer-based architectures, supports pre-training, and is capable of solving navigation and referring expression tasks simultaneously.

연구 동기 및 목표

  • VLN을 히스토리 의존적 의사결정을 필요로 하는 부분적으로 관찰 가능한 MDP로서 동기 부여 및 해결.
  • 순환형, 시간 의식 메커니즘을 도입하여 사전 학습된 비전-언어 BERT 모델을 활용.
  • 표준 GPU에서도 학습 가능하도록 메모리 소모를 줄이면서 교차 모달 학습을 보존.
  • VLN ∘→BERT가 복잡한 인코더-디코더 VLN 아키텍처를 대체하고 다중 작업 학습을 지원할 수 있음을 입증

제안 방법

  • V&L BERT에 순환 함수를 도입하여 VLN의 히스토리 의존 상태 표현을 모델링합니다.
  • 초기 인코딩 이후에 언어 토큰을 고정 상태로 두어 계산을 줄이면서 지시 표현을 보존합니다.
  • 매 단계에서 시각적 관찰을 처리하고 이를 현재 상태 및 초기 언어 인코딩과 Transformer 아키텍처를 통해 융합합니다.
  • 원시 텍스트 및 시각적 특징을 매칭하는 상태 정제 메커니즘을 정의하여 에이전트의 상태를 업데이트합니다.
  • 평균 시각 주의 가중치에서 행동 확률을 유도하고, REVERIE의 경우 주의 기반 점수 매기기를 통해 대상 물체를 근거화합니다.
  • 강화 학습(A2C)과 교사 행동에 대한 크로스 엔트로피를 혼합하여 학습합니다.
  • VLN ∘→BERT를 OSCAR 또는 PREVALENT 사전 학습 모델에서 초기화하여 VLN 관련 지식의 전달을 극대화합니다.

실험 결과

연구 질문

  • RQ1사전 학습된 시각-언어 BERT를 VLN의 부분 관찰성과 시간 의존성 처리에 어떻게 적용할 수 있는가?
  • RQ2V&L BERT의 순환 확장이 외부 메모리 모듈 없이도 경쟁력 있는 내비게이션 및 지시 표현 태스크를 달성할 수 있는가?
  • RQ3기존 VLN 사전 학습 모델(OSCAR, PREVALENT)로 초기화하는 것이 보지 않은 환경과 지시에 대한 일반화를 향상시키는가?
  • RQ4초기 인코딩 이후 언어 특징을 고정하는 것이 학습 효율성과 성능에 미치는 영향은 무엇인가?
  • RQ5단일 VLN 프레임워크가 내비게이션과 원격 지시 근거화(grounding)을 효과적으로 함께 다룰 수 있는가?

주요 결과

  • VLN ∘→BERT는 R2R 및 REVERIE에서 최첨단 결과를 달성하며, 추가 메모리 버퍼나 LSTM 없이 순환 V&L BERT를 사용합니다.
  • R2R 테스트 언seen에서 PREVALENT 사전 학습 모델을 사용한 경우 SR가 63%이고 SPL가 57%로 강한 일반화를 보여줍니다.
  • REVERIE 테스트 언seen에서 OSCAR PRETRAINING을 사용한 모델은 navigation SR 24.62%, SPL 19.48%를 달성하고 원격 근거화에서 RGS 12.65%, RGSPL 10.00%를 달성합니다.
  • PREVALENT로 초기화하는 것이 대부분의 분할 및 지표에서 일반적으로 최상의 결과를 제공하며, 다중 작업 성능을 위한 내비게이션 지향 VLN 사전 학습의 이점을 강조합니다.
  • 특정 상태 정제 및 교차 모달 매칭을 갖춘 단일 완전 미세 조정 VLN BERT를 사용하는 절차가, 매 단계에서 언어를 재-attend하는 변형보다 우수하며 GPU 메모리 사용도 관리 가능하게 유지합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.