Skip to main content
QUICK REVIEW

[論文レビュー] Audio-Visual Embodied Navigation.

Changan Chen, Unnat Jain|arXiv (Cornell University)|Dec 24, 2019
Tactile and Sensory Interactions参考文献 102被引用数 18
ひとこと要約

本論文では、3次元環境における音声と視覚の統合的埋め込みナビゲーションを導入し、エージェントが視覚的および聴覚的手がかりを用いてナビゲートできるようにする。エゴセントリックな音声・視覚的観測からなるマルチモーダル深層強化学習ポリシーを訓練することで、エージェントは反響音から空間の幾何構造を認識し、音源を局所化する能力を獲得し、音響的に現実的であるが複雑な空間においてナビゲーション性能を顕著に向上させる。

ABSTRACT

Moving around in the world is naturally a multisensory experience, but today's embodied agents are deaf - restricted to solely their visual perception of the environment. We introduce audio-visual navigation for complex, acoustically and visually realistic 3D environments. By both seeing and hearing, the agent must learn to navigate to an audio-based target. We develop a multi-modal deep reinforcement learning pipeline to train navigation policies end-to-end from a stream of egocentric audio-visual observations, allowing the agent to (1) discover elements of the geometry of the physical space indicated by the reverberating audio and (2) detect and follow sound-emitting targets. We further introduce audio renderings based on geometrical acoustic simulations for a set of publicly available 3D assets and instrument AI-Habitat to support the new sensor, making it possible to insert arbitrary sound sources in an array of apartment, office, and hotel environments. Our results show that audio greatly benefits embodied visual navigation in 3D spaces.

研究の動機と目的

  • 現在の埋め込みエージェントが視覚に依存するという限界を是正し、ナビゲーションに聴覚的認識を統合すること。
  • 複雑な3次元環境において反響音信号から空間の幾何構造を学習できるようにすること。
  • エゴセントリックな音声・視覚的観測からエンドツーエンドにナビゲーションポリシーを学習するためのトレーニングパイプラインを開発すること。
  • 多様な3次元環境におけるリアルな音響伝搬を可能にする、幾何的音響シミュレーションに基づく音響レンダリングシステムを構築すること。
  • 複雑で音響的に豊かな空間における音声のナビゲーション性能への影響を評価すること。

提案手法

  • エージェントは、3次元環境からの生のエゴセントリック音声および視覚的観測を処理するマルチモーダル深層強化学習パイプラインを用いて訓練される。
  • 音声特徴は、幾何的音響シミュレーションによって生成されたシミュレート音声信号から抽出され、反響および空間的手がかりを捉える。
  • ナビゲーションポリシーは、ターゲット音源へのナビゲーション距離を最小化するように強化学習を用いてエンドツーエンドに訓練される。
  • AI-Habitatを用いて、アパート、オフィス、ホテル環境におけるリアルな音響伝搬を可能にする、新規の音響レンダリングシステムが開発された。
  • 3次元アセット内での音源の任意配置をサポートしており、多様なトレーニングおよび評価シナリオを可能にする。
  • モデルは、音源を検出し、追従する一方で、音の減衰パターンから環境の幾何構造を推論する能力を学習する。

実験結果

リサーチクエスチョン

  • RQ1音声の手がかりは、複雑な3次元環境における視覚的ナビゲーション性能を向上させ得るか?
  • RQ2エージェントは、反響音信号からどのように空間の幾何構造を学習するか?
  • RQ3聴覚的認識を統合することで、埋め込みナビゲーションにおけるターゲット局所化はどの程度向上するか?
  • RQ4エゴセントリックな音声・視覚的観測からのエンドツーエンドトレーニングは、頑健なナビゲーションポリシーを生み出せるか?
  • RQ5現実的な音響環境において、音声ベースのナビゲーションは視覚のみのベースラインと比較してどう異なるか?

主な発見

  • 音声の手がかりは、複雑な3次元環境においてナビゲーション性能を顕著に向上させ、視覚のみのベースラインと比較して平均ナビゲーション距離を短縮する。
  • エージェントは、音声信号の減衰および反響パターンから環境の幾何構造を正しく認識する能力を獲得した。
  • 音声の統合により、視覚的に遮蔽されたり曖昧な状況でも、より頑健なターゲット局所化が可能になった。
  • 幾何的音響シミュレーションに基づく提案された音響レンダリングシステムにより、多様な屋内環境におけるリアルで制御可能な音響伝搬が実現された。
  • 音声・視覚的観測からのエンドツーエンドトレーニングにより、エージェントは空間構造を効果的に発見し、音源に従う能力を獲得した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。