Skip to main content
QUICK REVIEW

[논문 리뷰] Look, Listen, and Act: Towards Audio-Visual Embodied Navigation

Chuang Gan, Yiwei Zhang|arXiv (Cornell University)|2019. 12. 25.
Tactile and Sensory Interactions참고 문헌 45인용 수 10
한 줄 요약

이 논문은 비지전 시각 인식, 소리 방향 추정, 동적 경로 계획을 통합하여 미리 보지 않은 실내 환경에서 소리 원천으로 가는 에이전트를 안내하는 새로운 청각-시각 임베디드 탐색 프레임워크를 제안한다. 명시적 공간 기억과 청각-시각 인식을 결합함으로써, 탐색-행동 설정에서는 65% 이상의 성공률을 달성하고 비탐색 설정에서는 거의 60%의 성공률을 기록하여, 메모리와 명시적 지도를 사용하는 강력한 기준 모델들을 능가한다.

ABSTRACT

A crucial ability of mobile intelligent agents is to integrate the evidence from multiple sensory inputs in an environment and to make a sequence of actions to reach their goals. In this paper, we attempt to approach the problem of Audio-Visual Embodied Navigation, the task of planning the shortest path from a random starting location in a scene to the sound source in an indoor environment, given only raw egocentric visual and audio sensory data. To accomplish this task, the agent is required to learn from various modalities, i.e. relating the audio signal to the visual environment. Here we describe an approach to audio-visual embodied navigation that takes advantage of both visual and audio pieces of evidence. Our solution is based on three key ideas: a visual perception mapper module that constructs its spatial memory of the environment, a sound perception module that infers the relative location of the sound source from the agent, and a dynamic path planner that plans a sequence of actions based on the audio-visual observations and the spatial memory of the environment to navigate toward the goal. Experimental results on a newly collected Visual-Audio-Room dataset using the simulated multi-modal environment demonstrate the effectiveness of our approach over several competitive baselines.

연구 동기 및 목표

  • 에이전트가 자율 시각 및 청각 입력만을 사용하여 소리 원천으로 이동할 수 있도록 기계적 에이전트를 개발하는 것.
  • 감각 인식, 공간 기억, 순차적 의사결정을 통합하여 인간과 유사한 탐색 방식을 모델링하는 것.
  • 복잡한 레이아웃을 가진 이전에 본 적 없는 실내 환경에서의 일반화 성능 평가.
  • 새로운 다중 모달 시뮬레이션 환경을 사용하여 청각-시각 임베디드 탐색에 대한 벤치마크 수립.
  • 명시적 공간 기억과 청각-시각 융합이 탐색의 강건성과 성공률 향상에 기여하는 방식을 조사하는 것.

제안 방법

  • 시각 인식 매핑 모듈이 에이전트의 시야 기반 RGB 관측치로부터 2차원 점유 지ap을 생성한다.
  • 소리 인식 모듈이 원시 청각 입력을 사용하여 소리 원천의 상대적 방향과 거리를 추정한다.
  • 동적 경로 계획 모듈이 융합된 청각-시각 관측치와 에이전트의 내부 공간 기억을 기반으로 행동 시퀀스를 생성한다.
  • 에이전트는 실시간으로 공간 기억을 유지하고 갱신하여 사전 탐색 없이도 탐색이 가능하도록 한다.
  • 일반화 성능 향상을 위해 커리큘럼 학습과 보조 과제를 활용한 딥 강화 학습으로 프레임워크를 훈련시킨다.
  • 실제 물리 기반의 음파 전파와 복잡한 아파트 레이아웃을 모델링하는 새로운 시뮬레이션 환경인 Visual-Audio-Room(VAR)을 개발한다.

실험 결과

연구 질문

  • RQ1에이전트가 사전 지도 지식 없이 원시 시각 및 청각 입력만을 사용하여 소리 원천으로 이동하는 법을 학습할 수 있는가?
  • RQ2명시적 공간 기억은 이질적인 환경에서 탐색 성능을 어떻게 향상시키는가?
  • RQ3청각 및 시각 모odal이 청각-시각 임베디드 탐색 과제를 해결하는 데 기여하는 상대적 기여도는 어떠한가?
  • RQ4제안된 방법은 강력한 기준 모델들과 비교해 새로운 환경과 소리 원천으로의 일반화 성능이 어떻게 되는가?
  • RQ5에이전트는 단지 감각 피드백만을 사용하여 다른 방의 소리 원천 위치를 효과적으로 추론하고 문을 통해 이동할 수 있는가?

주요 결과

  • 제안된 에이전트는 모든 소리 원천에서 탐색-행동 설정에서 평균 65% 이상의 성공률을 기록하며, 최고의 기준 모델보다 거의 두 배의 성능 향상을 달성한다.
  • 비탐색 설정에서는 거의 60%의 성공률을 기록하여, 탐색과 명시적 지도를 모두 사용하는 가장 강력한 기준 모델보다 뛰어난 성능을 보였다.
  • 무작위 및 탐욕적 기준 모델은 15% 미만의 성공률을 기록하여, 효과적인 탐색을 위해서는 시각과 청각 모달의 통합이 필수적임을 입증한다.
  • 제안된 방법과 A3C 기반 기준 모델 간의 성능 격차는 인식과 계획을 분리함으로써 더 나은 일반화를 달성하는 데 있어 중요성을 강조한다.
  • 에이전트는 문을 통해 효율적으로 이동하고 복잡한 레이아웃을 탐색하는 데 성공하여, 공간 기억과 청각-시각 정렬을 효과적으로 활용하고 있음을 시사한다.
  • 결과는 명시적 공간 기억과 청각-시각 융합이 이질적인 환경에서의 일반화를 크게 향상시킨다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.