Skip to main content
QUICK REVIEW

[논문 리뷰] AVLEN: Audio-Visual-Language Embodied Navigation in 3D Environments

Sudipta Paul, Amit K. Roy–Chowdhury|arXiv (Cornell University)|2022. 10. 14.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

AVLEN은 3D 환경에서 청각-시각-언어 임베디드 내비게이션을 위한 다중모달 계층 강화학습 에이전트를 제안하며, 청각-시각적 신호를 사용할지 또는 인간 오라클에게 자연어 지시를 질의할지를 결정할 수 있도록 한다. 에이전트는 탐색 자율성과 전략적 질의 사이의 균형을 학습함으로써 청각 신호의 연속적 의존도를 줄이며, 특히 듣지 못한 소리나 간섭 소리가 존재하는 어려운 상황에서도 뛰어난 성능을 달성한다.

ABSTRACT

Recent years have seen embodied visual navigation advance in two distinct directions: (i) in equipping the AI agent to follow natural language instructions, and (ii) in making the navigable world multimodal, e.g., audio-visual navigation. However, the real world is not only multimodal, but also often complex, and thus in spite of these advances, agents still need to understand the uncertainty in their actions and seek instructions to navigate. To this end, we present AVLEN~ -- an interactive agent for Audio-Visual-Language Embodied Navigation. Similar to audio-visual navigation tasks, the goal of our embodied agent is to localize an audio event via navigating the 3D visual world; however, the agent may also seek help from a human (oracle), where the assistance is provided in free-form natural language. To realize these abilities, AVLEN uses a multimodal hierarchical reinforcement learning backbone that learns: (a) high-level policies to choose either audio-cues for navigation or to query the oracle, and (b) lower-level policies to select navigation actions based on its audio-visual and language inputs. The policies are trained via rewarding for the success on the navigation task while minimizing the number of queries to the oracle. To empirically evaluate AVLEN, we present experiments on the SoundSpaces framework for semantic audio-visual navigation tasks. Our results show that equipping the agent to ask for help leads to a clear improvement in performance, especially in challenging cases, e.g., when the sound is unheard during training or in the presence of distractor sounds.

연구 동기 및 목표

  • 청각-시각 신호를 사용하면서도 유추가 어려운 경우나 신호가 부족할 경우 자연어 지시를 인간 오라클에게 질의할 수 있는 임베디드 에이전트를 개발하는 것.
  • 기존의 에이전트들이 시각 또는 청각에만 의존하거나, 신호가 모호하거나 부재할 경우에 적응적으로 도움을 요청하지 못하는 한계를 해결하는 것.
  • 일시적, 간헐적 또는 간섭 소리가 존재하는 실생활과 유사한 내비게이션 상황에서의 강건성 향상.
  • 고수준의 모odal 선택과 저수준의 동작 정책을 종합적으로 학습하는 다중모달 계층 강화학습 프레임워크를 훈련하는 것.
  • 특히 청각 신호가 신뢰할 수 없거나 제공되지 않을 경우, 불필요한 질의를 최소화하면서 내비게이션 성공률을 극대화하는 것.

제안 방법

  • AVLEN은 고수준 정책이 청각-시각 신호 사용 또는 오라클에게 자연어 지시 질의 중에서 선택하도록 하는 계층 강화학습 아키텍처를 사용한다.
  • 에이전트는 두 개의 저수준 정책을 사용한다: 하나는 청각-시각 특징 기반 내비게이션을 위한 정책이고, 다른 하나는 자연어 지시를 내비게이션 가능한 동작으로 매핑하는 정책이다.
  • 청각 입력은 바이누럴 스펙트로그램($65 \times 26$)으로 처리되며, 시각 입력은 RGB 및 깊이 이미지로, 중심 자르기로 $64 \times 64$로 크기 조정된다.
  • 고수준 정책는 작업 완료와 질의 효율성의 균형을 맞추기 위해 보상 함수를 사용하여 질의 횟수를 최소화하면서 성공률을 극대화하도록 훈련된다.
  • 언어 정책($\pi_{\ell}$)은 수집된 트레이제토리-지시 쌍을 기반으로 미세조정되어 지시의 동작에 대한 정합도를 향상시킨다.
  • 모든 정책는 온라인 학습 없이 애자일 및 강화학습을 통해 훈련되며, $\pi_{\ell}$는 재사용된 시각-언어 데이터셋으로 사전 훈련된 후 AVLEN 훈련 중에 미세조정된다.

실험 결과

연구 질문

  • RQ1청각-시각 신호가 모호하거나 부재할 경우 인간 오라클에게 자연어 지시를 전략적으로 질의함으로써 임베디드 에이전트가 3D 환경 내비게이션 성공률을 향상시킬 수 있는가?
  • RQ2청각, 시각, 언어의 다중모달 신호 통합이 듣지 못한 소리나 간섭 소리가 존재하는 어려운 조건에서 내비게이션의 강건성을 어떻게 향상시키는가?
  • RQ3계층 강화학습 프레임워크가 에이전트가 자율성과 보조 기능 사이의 균형을 어떻게 유지하며 불필요한 질의를 최소화하는가?
  • RQ4에이전트의 언어 정책이 짧고 추상적인 자연어 지시를 정확한 내비게이션 동작으로 정합화하는 데 얼마나 잘 일반화되는가?
  • RQ5질의 횟수와 침묵 지속 시간이 에이전트의 청각 이벤트 정위치 능력에 어떤 영향을 미치는가?

주요 결과

  • AVLEN은 듣지 못한 소리 상황에서 72.1%의 성공률을 기록하여 질의 기능이 없는 베이스라인 에이전트보다 뚜렷이 뛰어난 성능을 보였다.
  • 간섭 소리가 존재하는 상황에서도 AVLEN은 68.3%의 성공률을 유지하여 청각 간섭에 강건함을 입증했다.
  • 다양한 난수 시드에 따른 에이전트 성능 변동은 낮았으며, 청취 가능, 듣지 못한, 간섭 소리 상황 각각 표준편차가 0.50, 0.53, 0.26이었다.
  • AVLEN은 질의 횟수에 매우 민감하게 반응하며, 허용된 질의 횟수가 많을수록 성공률이 증가했고, $\nu=2$일 때조차도 베이스라인을 앞서는 성능 유지를 보였다.
  • 언어 정책($\pi_{\ell}$)은 뛰어난 정합도 성능을 보였으며, 수집된 데이터 기반으로 미세조정한 결과 Step-3 내비게이션에서 45.3%의 성공률을 기록했고, 지시가 마스킹된 경우 17.0%에 그쳤다.
  • AVLEN은 침묵 지속 시간에 대해 뛰어난 강건성을 보였으며, 청각 신호가 더 오랫동안 정지된 경우에도 누적 성공률이 높게 유지되었고, 고침묵 상황에서 베이스라인을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.