Skip to main content
QUICK REVIEW

[논문 리뷰] BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving

Tang, Tao, Dafeng Wei|arXiv (Cornell University)|2024. 01. 02.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

BEV-CLIP는 BEVFormer에서 추출한 BEV 특징과 미세조정된 LLaMA2 LLM 및 지식 그래프에서 유래한 풍부한 텍스트 임베딩을 융합하여 자율주행에서 텍스트 기반 영상 검색을 위한 제로샷 텍스트-장면 검색을 가능하게 하는 최초의 다중모달 BEV(Bird's-Eye View) 검색 프레임워크를 제안한다. NuScenes 데이터셋에서 87.66%의 텍스트-비에프 검색 정확도를 달성하여 공통적이고 긴 尾(롱테일) 주행 시나리오에서 강력한 성능을 보이며, 공통의 교차모달 프롬프트와 다중 작업 학습을 통해 성능을 끌어올린다.

ABSTRACT

The rapid development of the autonomous driving industry has led to a significant accumulation of autonomous driving data. Consequently, there comes a growing demand for retrieving data to provide specialized optimization. However, directly applying previous image retrieval methods faces several challenges, such as the lack of global feature representation and inadequate text retrieval ability for complex driving scenes. To address these issues, firstly, we propose the BEV-TSR framework which leverages descriptive text as an input to retrieve corresponding scenes in the Bird's Eye View (BEV) space. Then to facilitate complex scene retrieval with extensive text descriptions, we employ a large language model (LLM) to extract the semantic features of the text inputs and incorporate knowledge graph embeddings to enhance the semantic richness of the language embedding. To achieve feature alignment between the BEV feature and language embedding, we propose Shared Cross-modal Embedding with a set of shared learnable embeddings to bridge the gap between these two modalities, and employ a caption generation task to further enhance the alignment. Furthermore, there lack of well-formed retrieval datasets for effective evaluation. To this end, we establish a multi-level retrieval dataset, nuScenes-Retrieval, based on the widely adopted nuScenes dataset. Experimental results on the multi-level nuScenes-Retrieval show that BEV-TSR achieves state-of-the-art performance, e.g., 85.78% and 87.66% top-1 accuracy on scene-to-text and text-to-scene retrieval respectively. Codes and datasets will be available.

연구 동기 및 목표

  • 2D 이미지 기반 검색의 한계를 해결하기 위해, 특히 전역 특징 표현이 열악하고 텍스트 이해 능력이 떨어지는 문제를 해결한다.
  • 기본 설명 텍스트를 입력으로 사용하여 복잡하고 긴 尾 주행 시나리오를 제로샷으로 검색할 수 있도록 한다.
  • 대규모 언어 모델(LLM)과 도메인 전용 지식 그래프를 통합하여 자율주행 환경에서의 텍스트 표현을 향상시킨다.
  • BEV와 텍스트 특징을 효과적으로 융합하기 위한 통합된 교차모달 정렬 메커니즘을 개발한다.
  • 캡션 생성을 포함한 다중 작업 학습을 통해 희귀하고 복잡한 시나리오에서의 검색 강인성을 향상시킨다.

제안 방법

  • BEVFormer을 사용하여 카메라 입력에서 전역적이고 다중 시점의 BEV 특징을 추출하며, 미세조정 없이도 통합된 3D 장면 표현을 가능하게 한다.
  • 디코더 전용 LLaMA2 LLM을 텍스트 인코더로 활용하며, LoRA를 통해 미세조정하여 복잡한 자율주행 장면 기술서를 더 잘 이해하도록 한다.
  • 도메인 특화 지식 그래프 임베딩을 통합하여 의미적 표현을 풍부하게 하고 자율주행 맥락에서의 일반화 능력을 향상시킨다.
  • 대비 학습 이전에 BEV와 텍스트 특징을 정렬하기 위해 공통 교차모달 프롬프트(Single Cross-Modal Prompt, SCP)를 도입하여 효과적인 교차모달 융합을 가능하게 한다.
  • 캡션 생성 헤드를 포함한 다중 작업 학습 설정을 통해 특징 추상화와 일반화 능력을 향상시킨다.
  • 공유 잠재 공간 내에서 BEV와 텍스트 임베딩을 대비 학습을 통해 정렬하여 검색 성능 최적화를 달성한다.

실험 결과

연구 질문

  • RQ12D 이미지 특징에 비해 BEV 특징이 텍스트-장면 검색의 전역 장면 표현을 크게 향상시킬 수 있는가?
  • RQ2미세조정된 LLaMA2 LLM이 복잡한 자율주행 장면 기술서 이해에서 표준 BERT 기반 텍스트 인코더를 능가할 수 있는가?
  • RQ3지식 그래프 임베딩 통합이 자율주행 환경에서 텍스트 특징의 의미적 풍부성과 검색 정확도를 향상시키는가?
  • RQ4공통 교차모달 프롬프트가 제로샷 검색을 위해 BEV와 텍스트 특징을 효과적으로 정렬할 수 있는가?
  • RQ5캡션 생성을 포함한 다중 작업 학습이 희귀하고 긴 尾 주행 시나리오에 대한 모델의 일반화 능력을 향상시키는가?

주요 결과

  • BEV-CLIP는 NuScenes 데이터셋에서 87.66%의 텍스트-비에프 검색 정확도를 달성하여 기준 모델들을 뛰어넘는 성능을 보였다.
  • LoRA를 통해 미세조정된 LLaMA2를 사용함으로써 B2T_R1 및 T2B_R1 지표에서 각각 약 6%와 10% 향상된 성능을 기록했다.
  • 지식 그래프 임베딩 통합은 텍스트 특징의 의미적 풍부성을 향상시키고, 특히 희귀 시나리오에서의 일반화 능력을 향상시켰다.
  • 공통 교차모달 프롬프트(Single Cross-Modal Prompt, SCP) 메커니즘이 백본 인코더를 수정하지 않아도 검색 지표를 크게 향상시켰다.
  • 더 다양한 NuScenes-QA 확장 데이터셋에서도 BEV-to-text 및 text-to-BEV 랭크@1에서 각각 66.37%와 67.90%의 강력한 성능을 유지하여 데이터 분포 이동에 대한 강인성을 입증했다.
  • 시각화 결과는 BEV-CLIP가 2D 방법이 표현하지 못하는 복잡한 전역 장면 구조를 효과적으로 포착함을 확인했으며, 특히 긴 尾 시나리오에서 뚜렷한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.