Skip to main content
QUICK REVIEW

[논문 리뷰] AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

Fanglong Yao, Yuanchang Yue|arXiv (Cornell University)|2024. 08. 28.
Simulation Techniques and ApplicationsDecision Sciences인용 수 3
한 줄 요약

이 논문은 UAV에서 항공우주 몸체 세계 모델을 위한 종합적인 벤치마크 세트인 AeroVerse를 소개한다. 시뮬레이션, 사전 훈련, 미세조정 및 평가를 통합하여, 첫 번째 대규모 실물 및 가상의 이미지-텍스트 데이터셋(AerialAgent-Ego10k 및 CyberAgent-Ego500k)을 제안하고, 다섯 가지 새로운 하류 작업을 정의하며, GPT-4 기반의 SkyAgent-Eval을 통해 종단 간 자율 UAV 지능을 가능하게 하여 2D/3D 시각-언어 모델 전반에서 성능 향상을 입증한다.

ABSTRACT

Aerospace embodied intelligence aims to empower unmanned aerial vehicles (UAVs) and other aerospace platforms to achieve autonomous perception, cognition, and action, as well as egocentric active interaction with humans and the environment. The aerospace embodied world model serves as an effective means to realize the autonomous intelligence of UAVs and represents a necessary pathway toward aerospace embodied intelligence. However, existing embodied world models primarily focus on ground-level intelligent agents in indoor scenarios, while research on UAV intelligent agents remains unexplored. To address this gap, we construct the first large-scale real-world image-text pre-training dataset, AerialAgent-Ego10k, featuring urban drones from a first-person perspective. We also create a virtual image-text-pose alignment dataset, CyberAgent Ego500k, to facilitate the pre-training of the aerospace embodied world model. For the first time, we clearly define 5 downstream tasks, i.e., aerospace embodied scene awareness, spatial reasoning, navigational exploration, task planning, and motion decision, and construct corresponding instruction datasets, i.e., SkyAgent-Scene3k, SkyAgent-Reason3k, SkyAgent-Nav3k and SkyAgent-Plan3k, and SkyAgent-Act3k, for fine-tuning the aerospace embodiment world model. Simultaneously, we develop SkyAgentEval, the downstream task evaluation metrics based on GPT-4, to comprehensively, flexibly, and objectively assess the results, revealing the potential and limitations of 2D/3D visual language models in UAV-agent tasks. Furthermore, we integrate over 10 2D/3D visual-language models, 2 pre-training datasets, 5 finetuning datasets, more than 10 evaluation metrics, and a simulator into the benchmark suite, i.e., AeroVerse, which will be released to the community to promote exploration and development of aerospace embodied intelligence.

연구 동기 및 목표

  • UAV 기반 항공우주 적용 분야에서 종합적인 벤치마크의 부족을 해결하기 위해.
  • 시뮬레이션, 사전 훈련, 미세조정 및 평가를 위한 통합 프레임워크를 개발하여 UAV 몸체 세계 모델의 연구 격차를 해소하기 위해.
  • UAV 에이전트를 위한 다섯 가지 새로운 하류 작업—장면 인식, 공간적 추론, 항법, 작업 계획, 동작 결정—을 정의하고 체계화하기 위해.
  • 비행기의 첫인칭 시점 데이터셋(AerialAgent-Ego10k 및 CyberAgent-Ego500k)을 개발하여 항공 에이전트를 위한 시각-언어 모델의 사전 훈련을 지원하기 위해.
  • GPT-4 기반의 평가 도구인 SkyAgent-Eval을 개발하여 다양한 UAV 작업 전반에서 모델 성능을 객관적이고도 영리하며 종합적으로 평가할 수 있도록 하기 위해.

제안 방법

  • 동적이고 관찰 가능한 환경 조건 하에서 UAV 비행 시뮬레이션을 위한 네 가지 현실적인 도시 풍경을 갖춘 시뮬레이션 플랫폼인 AeroSimulator를 개발하였다.
  • 실제 드론 영상 자료를 활용하여 항공 에이전트의 몸체 세계 모델 사전 훈련을 지원하는 대규모 실물 이미지-텍스트 데이터셋인 AerialAgent-Ego10k를 구축하였다.
  • 정렬된 이미지-텍스트-자세 정보를 포함한 가상의 합성 데이터셋인 CyberAgent-Ego500k를 제작하여 사전 훈련의 일반화 능력과 데이터 효율성을 향상시켰다.
  • 장면 인식, 공간적 추론, 항법 탐색, 작업 계획, 동작 결정 등의 다섯 가지 하류 작업을 정의하였으며, 각 작업에 맞는 지시 훈련 데이터셋(SkyAgent-Scene3k부터 SkyAgent-Act3k까지)을 전용으로 마련하였다.
  • GPT-4 기반의 다중 지표 평가 프레임워크인 SkyAgent-Eval을 설계하여 정확도, 일관성, 작업 특화 추론 등 여러 차원에서 모델 출력을 평가하였다.
  • 10개 이상의 2D/3D 시각-언어 모델, 두 개의 사전 훈련 데이터셋, 다섯 개의 미세조정 데이터셋, 10개 이상의 평가 지표를 통합하여 통합된 AeroVerse 벤치마크 세트를 구성하였다.

실험 결과

연구 질문

  • RQ1시뮬레이션에서 평가에 이르는 UAV 에이전트 개발 전 과정을 지원할 수 있는 종합적인 벤치마크 세트를 어떻게 설계할 수 있는가?
  • RQ2특히 4차원 시공간과 부분 관찰 가능성 조건에서 UAV 기반 몸체 지능을 위한 하류 작업을 정의하고 체계화하는 데 있어 핵심 과제는 무엇인가?
  • RQ32D 및 3D 시각-언어 모델은 UAV 환경에서 다양한 도시 풍경과 작업 유형 전반에서 얼마나 잘 일반화되는가?
  • RQ4GPT-4 기반 평가(SkyAgent-Eval)는 항공우주 몸체 작업에서 시각-언어 모델의 강점과 한계를 객관적으로 측정하고 드러내는 데 얼마나 효과적인가?
  • RQ5모델 크기와 아키텍처는 UAV 전용 몸체 추론 작업 성능에 어떤 영향을 미치는가?

주요 결과

  • Qwen-LV-7B 모델은 네 개의 도시 풍경 전반에서 가장 높은 평균 BLEU 점수를 기록하여 항공 장면 이해 능력에서 뛰어난 일반화 능력과 강건성을 입증하였다.
  • GPT-4o와 GPT-4-vision-review는 궤도 기술 작업에서 다른 모델들을 능가하여 가장 상세하고 시간선 정확도가 높은 비행 경로 해석을 제공하였다.
  • BLIP2-flan-t5-xxl는 작업 지침에 대한 준수 능력이 떨어져 종종 이미지 캡션 유형의 출력을 생성하여 구조화된 비행 경로 기술을 내보내지 못했다.
  • InstructBLIP 및 BLIP2 모델은 장면 캡션 기술(작업 1)에서 뛰어난 성능을 보였고, LLaVA 및 Mplug 시리즈 모델은 다중 모odal 추론(작업 4)에서 뛰어난 성능을 보였다.
  • 모델 파rameter를 7B에서 13B로 늘여도 성능 향상이 일관되게 나타나지 않아, 단순 스케일링만으로 UAV 몸체 작업에서의 일반화 능력 향상이 보장되지 않음을 시사하였다.
  • 3D-LLM 모델은 2D 이미지 기반 표현에 비해 3D 장면 입력 처리에 어려움을 겪어 상당히 떨어진 성능을 보였으며, 이는 3D 추론에서 아키텍처의 한계를 드러내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.