Skip to main content
QUICK REVIEW

[논문 리뷰] Object-and-Action Aware Model for Visual Language Navigation

Yuankai Qi, Zizheng Pan|arXiv (Cornell University)|2020. 07. 29.
Multimodal Machine Learning Applications참고 문헌 20인용 수 7
한 줄 요약

이 논문은 시각-언어 탐색(Vision-and-Language Navigation)을 위한 객체-행동 인식 모델(Object-and-Action Aware Model, OAAM)을 제안한다. 이 모델은 전용 어텐션 모듈을 사용해 객체 지시어와 행동 지시어를 별도로 인코딩함으로써, 언어를 시각적 인식과 방향성에 더 정확히 부착할 수 있도록 한다. 이 방법은 R2R에서 50%의 SPL, R4R에서 40%의 CLS를 기록하며 최신 기준 성능(SOTA)을 달성하였으며, 최적 경로에서의 이격도를 최소화하는 새로운 경로 손실을 통해 짧은 경로 탐색을 장려함으로써 성능이 향상되었다.

ABSTRACT

Vision-and-Language Navigation (VLN) is unique in that it requires turning relatively general natural-language instructions into robot agent actions, on the basis of the visible environment. This requires to extract value from two very different types of natural-language information. The first is object description (e.g., 'table', 'door'), each presenting as a tip for the agent to determine the next action by finding the item visible in the environment, and the second is action specification (e.g., 'go straight', 'turn left') which allows the robot to directly predict the next movements without relying on visual perceptions. However, most existing methods pay few attention to distinguish these information from each other during instruction encoding and mix together the matching between textual object/action encoding and visual perception/orientation features of candidate viewpoints. In this paper, we propose an Object-and-Action Aware Model (OAAM) that processes these two different forms of natural language based instruction separately. This enables each process to match object-centered/action-centered instruction to their own counterpart visual perception/action orientation flexibly. However, one side-issue caused by above solution is that an object mentioned in instructions may be observed in the direction of two or more candidate viewpoints, thus the OAAM may not predict the viewpoint on the shortest path as the next action. To handle this problem, we design a simple but effective path loss to penalize trajectories deviating from the ground truth path. Experimental results demonstrate the effectiveness of the proposed model and path loss, and the superiority of their combination with a 50% SPL score on the R2R dataset and a 40% CLS score on the R4R dataset in unseen environments, outperforming the previous state-of-the-art.

연구 동기 및 목표

  • 다양한 자연어 지시어를 시각적 탐색에 부착하는 데 도전하는 문제를 해결하기 위해, 객체 기술과 행동 명령어에 대해 별도의 처리가 필요하다는 점을 고려한다.
  • 기존 모델에서 객체와 행동 인코딩을 혼합함으로써 시각적 특징과 방향성 특징와의 최적 일치가 이루어지지 않는 한계를 극복한다.
  • 시각적 인식(객체에 대한 것)과 방향성 행동(이동에 대한 것) 간의 명확한 구분을 명시적으로 모델링하여, 미리 보지 않은 환경에서의 탐색 강건성을 향상시킨다.
  • 여러 시점에 목표 객체가 존재할 경우 최적 경로 선택이 어려운 문제를 해결하기 위해, 실제 경로에서의 이격도를 벗어나지 않도록 하는 경로 손실을 도입한다.
  • 특히 미리 보지 않은 환경으로의 제로샷 일반화 성능을 고려하여 표준 VLN 벤치마크에서 최신 기준 성능(SOTA)을 달성한다.

제안 방법

  • 자신의 어텐션 모듈을 사용해 자연어 지시어 내에서 객체 관련 및 행동 관련 어휘를 별도로 강조한다.
  • 객체 인식 어텐션 맵을 사용해 지시어 어휘와 후보 시점의 시각적 특징 간의 매칭을 유도한다(객체-비전 매칭).
  • 행동 인식 어텐션 맵을 사용해 지시어 어휘와 방향성 임베딩 간의 매칭을 유도한다(행동-방향성 매칭), 이는 시각적 인식과 독립적이다.
  • 객체-비전 및 행동-방향성 모듈의 출력을 동적 어텐션 메커니즘을 통해 통합하여 지시어와 시각적 맥락 양쪽에 주의를 기울인다.
  • 에이전트의 현재 위치와 최적 경로 상의 실제 지점 간의 L2 거리에 기반한 경로 손실을 도입하여 최단 경로 탐색을 장려한다.
  • 정확도와 경로 효율성 양쪽을 최적화하기 위해 교차 엔트로피와 경로 손실을 함께 사용하는 인식 학습(imitation learning)을 통해 모델을 종합적으로 훈련시킨다.

실험 결과

연구 질문

  • RQ1자연어 지시어 내의 객체 기술과 행동 명령어를 별도로 인코딩하는 것이 시각적 기반과 탐색 성능 향상에 기여하는가?
  • RQ2객체와 행동 정보를 별도로 처리하는 모듈식 아키텍처가 미리 보지 않은 환경에서의 일반화 성능 향상에 기여하는가?
  • RQ3경로 인식 손실 함수가 정확도 지표 외에도 경로 이격도를 효과적으로 줄이고 탐색 효율성을 향상시키는가?
  • RQ4제안된 OAAM 모델은 표준 VLN 벤치마크에서 성공률, SPL, CLS 측면에서 최신 기준 기법들과 비교해 어떻게 성능을 내는가?
  • RQ5개별 구성 요소(객체 인식, 행동 인식, 통합 모듈)가 최종 탐색 성공에 기여하는 정도는 어느 정도인가?

주요 결과

  • OAAM 모델은 R2R 데이터셋에서 미리 보지 않은 환경에서 50%의 SPL 점수를 기록하여 새로운 최신 기준 성능을 달성하였다.
  • R4R 데이터셋에서는 미리 보지 않은 환경에서 40%의 CLS 점수를 기록하였으며, 이는 두 번째로 좋은 방법보다 3% 높은 성능이며 새로운 SOTA를 기록하였다.
  • R4R 데이터셋의 미리 보지 않은 분할에서 강력한 베이스라인인 EnvDrop보다 최대 6% 높은 CLS 성능을 기록하였다.
  • 제거 실험(ablation study) 결과, 객체-행동 인식 설계와 경로 손실이 최적 성능을 내기 위해 모두 필수적임을 확인하였으며, 조합 시 가장 우수한 성능을 기록하였다.
  • 질적 분석 결과, 중간 단계에서 개별 모듈(OA 또는 AA)이 잘못된 예측을 해도, 적응형 융합 메커니즘이 존재함으로써 최종 행동 예측은 정확하게 유지되었다.
  • 경로 손실은 정확도 지표가 유사한 경우에도 기준 모델 대비 더 낮은 TL(경로 길이) 값을 기록함으로써, 경로 이격도 감소에 효과적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.