Skip to main content
QUICK REVIEW

[論文レビュー] BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving

Tang, Tao, Dafeng Wei|arXiv (Cornell University)|Jan 2, 2024
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

BEV-CLIPは、BEVFormerから得られるBEV特徴と、微調整されたLLaMA2 LLMおよび知識グラフから得られる強化されたテキスト埋め込みを統合することで、自己教師付きのゼロショットテキストからシーンへの検索を可能にする、最初のマルチモーダルBEV(上空視点)検索フレームワークを提案する。本手法はNuScenesデータセットで87.66%のテキストからBEVへの検索精度を達成し、共通のクロスモーダルプロンプトとマルチタスク学習を通じて、複雑でレアな走行シナリオにおいて優れた性能を示している。

ABSTRACT

The rapid development of the autonomous driving industry has led to a significant accumulation of autonomous driving data. Consequently, there comes a growing demand for retrieving data to provide specialized optimization. However, directly applying previous image retrieval methods faces several challenges, such as the lack of global feature representation and inadequate text retrieval ability for complex driving scenes. To address these issues, firstly, we propose the BEV-TSR framework which leverages descriptive text as an input to retrieve corresponding scenes in the Bird's Eye View (BEV) space. Then to facilitate complex scene retrieval with extensive text descriptions, we employ a large language model (LLM) to extract the semantic features of the text inputs and incorporate knowledge graph embeddings to enhance the semantic richness of the language embedding. To achieve feature alignment between the BEV feature and language embedding, we propose Shared Cross-modal Embedding with a set of shared learnable embeddings to bridge the gap between these two modalities, and employ a caption generation task to further enhance the alignment. Furthermore, there lack of well-formed retrieval datasets for effective evaluation. To this end, we establish a multi-level retrieval dataset, nuScenes-Retrieval, based on the widely adopted nuScenes dataset. Experimental results on the multi-level nuScenes-Retrieval show that BEV-TSR achieves state-of-the-art performance, e.g., 85.78% and 87.66% top-1 accuracy on scene-to-text and text-to-scene retrieval respectively. Codes and datasets will be available.

研究の動機と目的

  • 2D画像ベースの検索における限界、特にグローバル特徴表現の悪さとテキスト理解力の弱さを是正すること。
  • 記述的テキストを入力として用い、複雑でレアな走行シーンのゼロショット検索を可能にすること。
  • 大規模言語モデル(LLM)とドメイン固有の知識グラフを統合することで、自律走行におけるテキスト表現を強化すること。
  • BEVとテキスト特徴を効果的に統合するための統一されたクロスモーダルアライメントメカニズムを開発すること。
  • キャプション生成を含むマルチタスク学習により、レアかつ複雑なシナリオにおける検索のロバスト性を向上させること。

提案手法

  • 微調整なしでカメラ入力からグローバルかつマルチビューのBEV特徴を抽出するBEVFormerを活用し、統一された3次元シーン表現を実現する。
  • テキストエンコーダーとして、LoRAを用いて微調整されたデコーダー専用のLLaMA2 LLMを採用し、複雑な自律走行シーン記述の理解を向上させる。
  • ドメイン固有の知識グラフ埋め込みを統合することで、意味的表現を強化し、自律走行文脈における一般化性能を向上させる。
  • 対照学習の前にBEVとテキスト特徴をアライメントするための共有クロスモーダルプロンプト(SCP)を導入し、効果的なクロスモーダル統合を実現する。
  • 特徴の抽象化と一般化を向上させるために、キャプション生成ヘッドを含むマルチタスク学習設定を採用する。
  • 対照学習を適用し、共通の潜在空間内でBEVとテキスト埋め込みをアライメントすることで、検索パフォーマンスを最適化する。

実験結果

リサーチクエスチョン

  • RQ12D画像特徴と比較して、BEV特徴はテキストからシーンへの検索におけるグローバルシーン表現を顕著に向上させるか?
  • RQ2微調整されたLLaMA2 LLMは、標準的なBERTベースのテキストエンコーダーよりも、複雑な自律走行シーン記述の理解において優れているか?
  • RQ3知識グラフ埋め込みの統合により、自律走行文脈におけるテキスト特徴の意味的豊かさと検索精度が向上するか?
  • RQ4共有クロスモーダルプロンプトは、ゼロショット検索のためのBEVとテキスト特徴の効果的アライメントを実現できるか?
  • RQ5キャプション生成を含むマルチタスク学習により、モデルのレアで長尾の走行シナリオへの一般化能力が向上するか?

主な発見

  • BEV-CLIPはNuScenesデータセットで87.66%のテキストからBEVへの検索精度を達成し、ベースライン手法を顕著に上回っている。
  • LoRAを用いて微調整したLLaMA2の使用により、BERTベースのベースラインと比較して、B2T_R1とT2B_R1の指標でそれぞれ約6%および10%のパフォーマンス向上が達成された。
  • 知識グラフ埋め込みの統合により、テキスト特徴の意味的豊かさが向上し、特にレアなシナリオにおけるモデルの一般化性能が向上した。
  • 共有クロスモーダルプロンプト(SCP)メカニズムは、バックボーンエンコーダーを変更しないままでも、検索指標を顕著に改善した。
  • より多様なNuScenes-QA拡張データセットでも、BEVからテキスト(66.37%)およびテキストからBEV(67.90%)のランク@1において強力な性能を維持しており、データ分布のシフトに対してもロバストであることが示された。
  • 可視化結果から、BEV-CLIPが2D手法が表現できない複雑でグローバルなシーン構造を効果的に捉えていることが確認された。特に長尾シナリオにおいて顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。