Skip to main content
QUICK REVIEW

[論文レビュー] AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

Fanglong Yao, Yuanchang Yue|arXiv (Cornell University)|Aug 28, 2024
Simulation Techniques and ApplicationsDecision Sciences被引用数 3
ひとこと要約

本論文は、ドローン(UAV)における航空宇宙分野の体現的ワールドモデルを対象とした包括的ベンチマークスイート「AeroVerse」を紹介する。シミュレーション、事前学習、微調整、評価を統合しており、本稿では、最初のスケールの大きな実写および仮想の画像・テキストデータセット(AerialAgent-Ego10k および CyberAgent-Ego500k)を提案し、5つの新しい下流タスクを定義し、GPT-4を活用したSkyAgent-Evalによる評価を導入することで、2D/3Dの視覚言語モデルを用いたエンド・ツー・エンドの自律的ドローン知能を実現。性能向上が確認された。

ABSTRACT

Aerospace embodied intelligence aims to empower unmanned aerial vehicles (UAVs) and other aerospace platforms to achieve autonomous perception, cognition, and action, as well as egocentric active interaction with humans and the environment. The aerospace embodied world model serves as an effective means to realize the autonomous intelligence of UAVs and represents a necessary pathway toward aerospace embodied intelligence. However, existing embodied world models primarily focus on ground-level intelligent agents in indoor scenarios, while research on UAV intelligent agents remains unexplored. To address this gap, we construct the first large-scale real-world image-text pre-training dataset, AerialAgent-Ego10k, featuring urban drones from a first-person perspective. We also create a virtual image-text-pose alignment dataset, CyberAgent Ego500k, to facilitate the pre-training of the aerospace embodied world model. For the first time, we clearly define 5 downstream tasks, i.e., aerospace embodied scene awareness, spatial reasoning, navigational exploration, task planning, and motion decision, and construct corresponding instruction datasets, i.e., SkyAgent-Scene3k, SkyAgent-Reason3k, SkyAgent-Nav3k and SkyAgent-Plan3k, and SkyAgent-Act3k, for fine-tuning the aerospace embodiment world model. Simultaneously, we develop SkyAgentEval, the downstream task evaluation metrics based on GPT-4, to comprehensively, flexibly, and objectively assess the results, revealing the potential and limitations of 2D/3D visual language models in UAV-agent tasks. Furthermore, we integrate over 10 2D/3D visual-language models, 2 pre-training datasets, 5 finetuning datasets, more than 10 evaluation metrics, and a simulator into the benchmark suite, i.e., AeroVerse, which will be released to the community to promote exploration and development of aerospace embodied intelligence.

研究の動機と目的

  • ドローンを用いた航空宇宙分野の体現的知能の分野における包括的ベンチマークの不足に対処すること。
  • シミュレーション、事前学習、微調整、評価を統合した統一フレームワークを構築することで、ドローンの体現的ワールドモデルにおける研究ギャップを埋めること。
  • ドローンエージェントのための5つの新しい下流タスク(シーン認識、空間的推論、ナビゲーション、タスク計画、運動意思決定)を定義・構造化すること。
  • 空中エージェントの視覚言語モデルの事前学習を支援する高精細で第一人称視点のデータセット(AerialAgent-Ego10k および CyberAgent-Ego500k)を構築すること。
  • GPT-4を活用した評価スイート「SkyAgent-Eval」を開発し、ドローンの多様なタスクにおけるモデル性能を客観的かつ柔軟かつ包括的に評価可能にする。

提案手法

  • 動的かつ観察可能な環境条件下でドローン飛行をシミュレートできる、4つのリアルな都市シーンを備えたシミュレーションプラットフォーム「AeroSimulator」を開発した。
  • 空中エージェントの体現的ワールドモデルの事前学習を支援するため、第一人称ドローン映像を用いた大規模な実世界の画像・テキストデータセット「AerialAgent-Ego10k」を構築した。
  • 視覚的・テキスト的・ポーズのアノテーションが整合した、合成された仮想データセット「CyberAgent-Ego500k」を構築し、事前学習の汎化性能とデータ効率を向上させた。
  • 各タスクに特化した指示微調整データセット(SkyAgent-Scene3k から SkyAgent-Act3k)を備えた、5つの下流タスク(シーン認識、空間的推論、ナビゲーション探索、タスク計画、運動意思決定)を定義した。
  • GPT-4を基盤とする複数指標評価フレームワーク「SkyAgent-Eval」を設計し、正確性、一貫性、タスク固有の推論など、複数の次元でモデル出力を評価した。
  • 10種類以上の2D/3D視覚言語モデル、2つの事前学習データセット、5つの微調整データセット、10以上の評価指標を統合し、統一されたAeroVerseベンチマークスイートを構築した。

実験結果

リサーチクエスチョン

  • RQ1エンド・ツー・エンドのドローンエージェント開発パイプライン(シミュレーションから評価まで)を支援する包括的ベンチマークスイートをどのように設計できるか?
  • RQ24次元の時空間的環境および部分観察性を考慮した場合、ドローンベースの体現的知能のための下流タスクを定義・構造化する上で直面する主な課題は何か?
  • RQ32Dおよび3Dの視覚言語モデルは、都市部の多様なシーンやタスクタイプにおいて、ドローン環境でどれほど汎化するのか?
  • RQ4GPT-4を活用した評価(SkyAgent-Eval)は、航空宇宙分野の体現的タスクにおける視覚言語モデルの強みと弱みを客観的に測定・特定するのにどの程度効果的か?
  • RQ5モデルサイズやアーキテクチャは、ドローン固有の体現的推論タスクにおける性能にどのような影響を及えるか?

主な発見

  • Qwen-LV-7Bモデルは、4つの都市シーンすべてで最高の平均BLEUスコアを達成し、空中シーン理解における優れた汎化性能と頑健性を示した。
  • GPT-4oおよびGPT-4-vision-reviewは、軌道記述タスクで他のモデルを上回り、最も詳細かつタイムラインに正確なフライトパス解釈を提供した。
  • BLIP2-flan-t5-xxlは、タスク固有の指示に従わず、しばしば画像キャプションのような出力を生成し、構造化されたフライトパス記述とはならなかった。
  • InstructBLIPやBLIP2は、シーンキャプション(タスク1)で優れた性能を示した一方、LLaVAやMplugシリーズのモデルは、マルチモーダル推論(タスク4)で優れた性能を発揮した。
  • 7Bから13Bへのパラメータ数の増加は、一貫した性能向上をもたらさず、スケーリングそのものがUAVの体現的タスクにおける汎化性能の向上を保証しないことを示した。
  • 3D-LLMモデルは、2D画像ベースの表現と比較して3Dシーン入力を処理する際の課題により、著しく性能が低かった。これは、3D推論におけるアーキテクチャ的制限を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。