Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge-driven Scene Priors for Semantic Audio-Visual Embodied Navigation

Gyan Tatiya, Jonathan Francis|arXiv (Cornell University)|Dec 21, 2022
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿は、強化学習フレームワーク内に、物体領域および領域間の関係を新たにエンコードする知識グラフ、空間推論のための二重グラフエンコーダーネットワーク、および事前学習済みの視覚的・音声的エンコーダーを統合することで、意味的音声視覚的自己体験ナビゲーションのための知識駆動型シーン事前分布を導入する。この手法は、未確認の領域および真正に新しい音を発する物体への一般化性能を著しく向上させ、Habitat-Matterport3D環境における未確認の文脈において強力なベースラインを上回る性能を達成する。

ABSTRACT

Generalisation to unseen contexts remains a challenge for embodied navigation agents. In the context of semantic audio-visual navigation (SAVi) tasks, the notion of generalisation should include both generalising to unseen indoor visual scenes as well as generalising to unheard sounding objects. However, previous SAVi task definitions do not include evaluation conditions on truly novel sounding objects, resorting instead to evaluating agents on unheard sound clips of known objects; meanwhile, previous SAVi methods do not include explicit mechanisms for incorporating domain knowledge about object and region semantics. These weaknesses limit the development and assessment of models' abilities to generalise their learned experience. In this work, we introduce the use of knowledge-driven scene priors in the semantic audio-visual embodied navigation task: we combine semantic information from our novel knowledge graph that encodes object-region relations, spatial knowledge from dual Graph Encoder Networks, and background knowledge from a series of pre-training tasks -- all within a reinforcement learning framework for audio-visual navigation. We also define a new audio-visual navigation sub-task, where agents are evaluated on novel sounding objects, as opposed to unheard clips of known objects. We show improvements over strong baselines in generalisation to unseen regions and novel sounding objects, within the Habitat-Matterport3D simulation environment, under the SoundSpaces task.

研究の動機と目的

  • 見たことのない環境や既知でない音に対して、自己体験エージェントの一般化性能を向上させること。
  • 先行のSAViベンチマークにおいて真正に新しい音を発する物体の評価が不足している点を是正すること。
  • 物体領域の意味的特性および空間的関係に関するドメイン知識をナビゲーション方策に統合すること。
  • サンプル効率性と意思決定の解釈可能性を向上させるモジュラーで知識強化型のフレームワークを開発すること。
  • 既知の物体の録音とは異なり、真正に新しい音を発する物体を評価する新しいベンチマークタスクを定義すること。

提案手法

  • 屋内環境における物体同士、物体領域、領域間の関係をエンコードする新しい知識グラフを構築する。
  • 物体と領域間の空間的および意味的関係をモデル化するための二重グラフエンコーダーネットワークを採用する。
  • オブジェクト認識力と音声理解力を強化するため、選別されたマルチモーダルデータセット上で視覚的・音声的エンコーダーを事前学習する。
  • メモリベースのアテンションメカニズムを用いて、知識駆動型シーン事前分布を強化学習フレームワークに統合する。
  • クロスドメイン一般化を向上させるとともに、視覚および音声モダリティの推論を最適化するためのモジュラーな訓練パラダイムを採用する。
  • ナビゲーション意思決定のための視覚的・音声的および知識ベースの推論を統合するためのマルチストリームアテンションメカニズム(SMT)を適用する。

実験結果

リサーチクエスチョン

  • RQ1知識駆動型シーン事前分布は、意味的音声視覚的ナビゲーションにおける未確認の屋内環境への一般化を向上させることができるか?
  • RQ2物体領域および領域間の明示的な意味的関係を組み込むことで、真正に新しい音を発する物体に対するエージェントの性能が向上するか?
  • RQ3選別された視覚データセット上で事前学習を実施することで、オブジェクト認識力とナビゲーション成功確率にどのような影響を与えるか?
  • RQ4モジュラーで知識強化型の強化学習フレームワークは、未確認の領域および未聞の音に対するゼロショット一般化において強力なベースラインを上回ることができるか?
  • RQ5知識統合は、マルチモーダルナビゲーションにおけるサンプル効率性および意思決定の解釈可能性をどの程度向上させるか?

主な発見

  • 提案されたK-SAVENモデルは、未確認の住宅内シーン(UH/HS)で73.2%の成功率を達成し、未確認の音(UH/US)でも31.9%の成功率を示し、強力なベースラインを上回る。
  • UH/HS設定では、only-GENVおよびboth-GENsモデルがそれぞれ73.2%および73.0%の成功率を示し、only-GENB(64.4%)を著しく上回る。
  • UH/US設定では、only-GENBが23.3%の成功率を示し、only-GENV(21.2%)を上回る。これは、音声推論が新しい音に対してより重要であることを示唆する。
  • 視覚的および音声的知識ストリームを併用する完全なモデル(both-GENs)は、SAViよりも高いSPLおよびSNAスコアを達成しており、より短く、より効率的な経路を示している。
  • 定性的な結果から、K-SAVENの経路はSAViよりも直接的で、より少ないステップ数でゴールに到達し、迷走も少ない。
  • アブレーションスタディの結果、視覚的および音声的推論に知識事前分布を組み合わせることで、単一モダリティのみを用いる場合よりも優れた一般化性能が得られることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。