Skip to main content
QUICK REVIEW

[論文レビュー] AVLEN: Audio-Visual-Language Embodied Navigation in 3D Environments

Sudipta Paul, Amit K. Roy–Chowdhury|arXiv (Cornell University)|Oct 14, 2022
Multimodal Machine Learning Applications被引用数 9
ひとこと要約

AVLENは、3次元環境における音声・視覚・言語統合型エージェントを提案する。このエージェントは、音声・視覚的情報を使用するか、人間のオラクルに自然言語の指示を照会するかを判断できる。エージェントは、ナビゲーションの自律性と戦略的照会のバランスを学習することで、特に未聞の音声や干渉音が存在するような困難な状況でも優れた性能を発揮し、継続的な音声的情報への依存を低減する。

ABSTRACT

Recent years have seen embodied visual navigation advance in two distinct directions: (i) in equipping the AI agent to follow natural language instructions, and (ii) in making the navigable world multimodal, e.g., audio-visual navigation. However, the real world is not only multimodal, but also often complex, and thus in spite of these advances, agents still need to understand the uncertainty in their actions and seek instructions to navigate. To this end, we present AVLEN~ -- an interactive agent for Audio-Visual-Language Embodied Navigation. Similar to audio-visual navigation tasks, the goal of our embodied agent is to localize an audio event via navigating the 3D visual world; however, the agent may also seek help from a human (oracle), where the assistance is provided in free-form natural language. To realize these abilities, AVLEN uses a multimodal hierarchical reinforcement learning backbone that learns: (a) high-level policies to choose either audio-cues for navigation or to query the oracle, and (b) lower-level policies to select navigation actions based on its audio-visual and language inputs. The policies are trained via rewarding for the success on the navigation task while minimizing the number of queries to the oracle. To empirically evaluate AVLEN, we present experiments on the SoundSpaces framework for semantic audio-visual navigation tasks. Our results show that equipping the agent to ask for help leads to a clear improvement in performance, especially in challenging cases, e.g., when the sound is unheard during training or in the presence of distractor sounds.

研究の動機と目的

  • 音声・視覚的情報を用いて3次元環境をナビゲートできるエージェントを開発すること。また、状況が不明瞭または情報が欠落している場合には、自然言語の指示を人間のオラクルに照会する戦略的行動をとること。
  • 視覚や音声に依存する既存のエージェントの限界を解消し、状況が曇っているか、情報が欠落している場合に適応的に支援を求める能力を持つエージェントを開発すること。
  • 一時的・間欠的・干渉音が存在するような現実世界に近いナビゲーション状況における耐性を高めること。
  • 高レベルのモodal選択と低レベルの行動方針を一括して学習する、マルチモーダル階層強化学習フレームワークを訓練すること。
  • 不要な照会を最小限に抑えつつ、特に音声的情報が信頼できないか、利用できない状況でのナビゲーション成功確率を最大化すること。

提案手法

  • AVLENは、音声・視覚的情報を使用するか、オラクルに自然言語の指示を照会するかを選択する高レベル方策を採用する階層強化学習アーキテクチャを採用している。
  • エージェントは2つの低レベル方策を用いる:1つは音声・視覚特徴に基づくナビゲーション用、もう1つは自然言語の指示をナビゲーション可能な行動に変換するためのもの。
  • 音声入力はバイナリルスケッチグラム($65 \times 26$)として処理され、視覚入力はRGBおよび深度画像であり、中央に切り取って$64 \times 64$にリサイズされる。
  • 高レベル方策は、照会回数を最小限に抑えつつ成功確率を最大化するように訓練され、タスク完了と照会効率の両方をバランスにとった報酬関数が使用される。
  • 言語方策($\pi_{\ell}$)は、収集したトラジェクトリ-と指示のペアを用いて微調整され、指示の行動への対応精度が向上する。
  • すべての方策は、イmitation学習と強化学習を用いてオフラインで訓練され、$\pi_{\ell}$は再利用可能な視覚言語データセットを用いて事前学習され、AVLENの訓練中に微調整される。

実験結果

リサーチクエスチョン

  • RQ1音声・視覚的情報が曇っているか欠落している場合に、人間のオラクルに自然言語の指示を戦略的に照会することで、3次元環境におけるナビゲーション成功確率を向上させることができるか?
  • RQ2音声、視覚、言語の3モーダル情報を統合することで、未聞の音声や干渉音が存在するような困難な条件下でのナビゲーションの耐性がどのように向上するか?
  • RQ3階層強化学習フレームワークは、不要な照会を最小限に抑えつつ、自律性と支援のバランスをどのように実現できるか?
  • RQ4エージェントの言語方策は、短く抽象的な自然言語の指示を、正しいナビゲーション行動に正確に変換できるか?
  • RQ5照会回数と沈黙時間の長さが、エージェントが音声イベントを正しく局所化する能力に与える影響は何か?

主な発見

  • AVLENは、未聞の音声状況下で72.1%の成功率を達成し、照会機能を持たないベースラインエージェントを著しく上回った。
  • 干渉音が存在する状況下でも、AVLENは68.3%の成功率を維持し、音声干渉への耐性を示した。
  • 異なる乱数シードにおけるエージェントの性能ばらつきは低く、聴取可能、未聞、干渉音状況それぞれで標準偏差が0.50、0.53、0.26であった。
  • AVLENは照会回数に強く感受性を示した:許可された照会回数が増えるほど成功確率が上昇し、$\nu=2$の状況でもベースラインを上回った。
  • 言語方策($\pi_{\ell}$)は優れた対応性能を示し、収集データを用いた微調整後、ステップ3ナビゲーションで45.3%の成功率を達成した。一方、指示がマスクされた状況では17.0%にとどまった。
  • AVLENは沈黙時間の長さに対して優れた耐性を示し、長時間の沈黙状況下でも累積的成功率が高く維持され、ベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。