Skip to main content
QUICK REVIEW

[논문 리뷰] Audio-Visual Embodied Navigation.

Changan Chen, Unnat Jain|arXiv (Cornell University)|2019. 12. 24.
Tactile and Sensory Interactions참고 문헌 102인용 수 18
한 줄 요약

이 논문은 3차원 환경에서 청각-시각 임베디드 탐색을 소개하며, 에이전트가 시각적 및 청각적 신호를 모두 활용해 이동할 수 있도록 한다. 자기 중심적 청각-시각 관측을 기반으로 다중 모odal 딥 강화 학습 정책을 훈련시킴으로써, 에이전트는 반향성 음향으로부터 공간 기하학을 인지하고 소리가 나는 목표물을 정위치화할 수 있게 되어, 음향적으로 현실적인 복잡한 공간에서 탐색 성능이 크게 향상된다.

ABSTRACT

Moving around in the world is naturally a multisensory experience, but today's embodied agents are deaf - restricted to solely their visual perception of the environment. We introduce audio-visual navigation for complex, acoustically and visually realistic 3D environments. By both seeing and hearing, the agent must learn to navigate to an audio-based target. We develop a multi-modal deep reinforcement learning pipeline to train navigation policies end-to-end from a stream of egocentric audio-visual observations, allowing the agent to (1) discover elements of the geometry of the physical space indicated by the reverberating audio and (2) detect and follow sound-emitting targets. We further introduce audio renderings based on geometrical acoustic simulations for a set of publicly available 3D assets and instrument AI-Habitat to support the new sensor, making it possible to insert arbitrary sound sources in an array of apartment, office, and hotel environments. Our results show that audio greatly benefits embodied visual navigation in 3D spaces.

연구 동기 및 목표

  • 현재의 임베디드 에이전트가 시각에만 의존하는 한계를 해결하고자 청각 인지를 탐색에 통합한다.
  • 복잡한 3차원 환경에서 반향성 음향 신호로부터 공간 기하학을 학습할 수 있도록 한다.
  • 자기 중심적 청각-시각 관측에서 종단간(end-to-end)으로 탐색 정책을 학습하는 훈련 파이프라인을 개발한다.
  • 다양한 3차원 환경에서 실감나는 음향 전파를 가능하게 하는 기하학적 음향 시뮬레이션 기반의 현실적인 음향 렌더링 시스템을 구축한다.
  • 복잡하고 음향적으로 풍부한 공간에서 음향의 영향이 시각 탐색 성능에 미치는 영향을 평가한다.

제안 방법

  • 에이전트는 3차원 환경에서의 원시 자기 중심적 청각 및 시각 관측을 처리하는 다중 모달 딥 강화 학습 파이프라인을 사용해 훈련된다.
  • 청각 특징은 기하학적 음향 시뮬레이션을 통해 생성된 시뮬레이션된 음향 신호에서 추출되며, 반향성과 공간적 정보를 포괄한다.
  • 목표 음원까지의 이동 거리를 최소화하도록 강화 학습을 통해 종단간으로 탐색 정책을 훈련시킨다.
  • AI-Habitat를 활용해 새로운 음향 렌더링 시스템을 개발하여 아파트, 사무실, 호텔 환경에서의 현실적인 음향 전파를 가능하게 한다.
  • 3D 자산 내에서 음향 소스의 임의의 배치를 지원하여 다양한 훈련 및 평가 시나리오를 가능하게 한다.
  • 모델은 소리 나는 목표물을 탐지하고 따라가며, 음향 감쇠 패턴으로부터 환경 기하학을 추론할 수 있도록 학습된다.

실험 결과

연구 질문

  • RQ1청각 신호는 복잡한 3차원 환경에서 시각 탐색 성능을 향상시킬 수 있는가?
  • RQ2에이전트는 반향성 음향 신호로부터 어떻게 공간 기하학을 학습하는가?
  • RQ3청각 인지를 통합함으로써 탐색 임베디드 환경에서 목표 정위치화 성능은 얼마나 향상되는가?
  • RQ4자기 중심적 청각-시각 관측에서 종단간 훈련을 통해 강건한 탐색 정책을 도출할 수 있는가?
  • RQ5실제 음향 환경에서 청각 기반 탐색은 시각 전용 기준 성능과 비교해 어떻게 다른가?

주요 결과

  • 청각 신호는 복잡한 3차원 환경에서 탐색 성능을 크게 향상시키며, 시각 전용 기준 대비 평균 이동 거리를 줄인다.
  • 에이전트는 음향 신호의 감쇠 및 반향 패턴으로부터 환경 기하학을 성공적으로 인지한다.
  • 청각 통합은 특히 시각적으로 가림되거나 모호한 장면에서 더 강건한 목표 정위치화를 가능하게 한다.
  • 기하학적 음향 시뮬레이션 기반의 제안된 음향 렌더링 시스템은 다양한 실내 환경에서 현실적이고 제어 가능한 음향 전파를 가능하게 한다.
  • 청각-시각 관측에서 종단간 훈련을 통해 에이전트는 공간적 구조를 탐지하고 소리 원천을 효과적으로 따라갈 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.