Skip to main content
QUICK REVIEW

[論文レビュー] ADriver-I: A General World Model for Autonomous Driving

Fan Jia, Weixin Mao|arXiv (Cornell University)|Nov 22, 2023
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本論文は、マルチモodalな大規模言語モデル(MLLM)と動画拡散モデル(VDM)を用いて、視覚-行動予測と将来のシーン生成を統合する一般化された世界モデル、ADriver-Iを提案する。インタリーブドされた視覚-行動ペアを活用することで、ADriver-Iは閉ループにおいて自己持続的な走行を可能にする自己回帰的制御信号予測と将来のフレーム生成を実現し、L1制御誤差が速度で0.072 m/s(速度)、ステアリング角度で0.091 radであり、FID/FVDスコアはそれぞれ5.52および97.0を達成した。

ABSTRACT

Typically, autonomous driving adopts a modular design, which divides the full stack into perception, prediction, planning and control parts. Though interpretable, such modular design tends to introduce a substantial amount of redundancy. Recently, multimodal large language models (MLLM) and diffusion techniques have demonstrated their superior performance on comprehension and generation ability. In this paper, we first introduce the concept of interleaved vision-action pair, which unifies the format of visual features and control signals. Based on the vision-action pairs, we construct a general world model based on MLLM and diffusion model for autonomous driving, termed ADriver-I. It takes the vision-action pairs as inputs and autoregressively predicts the control signal of the current frame. The generated control signals together with the historical vision-action pairs are further conditioned to predict the future frames. With the predicted next frame, ADriver-I performs further control signal prediction. Such a process can be repeated infinite times, ADriver-I achieves autonomous driving in the world created by itself. Extensive experiments are conducted on nuScenes and our large-scale private datasets. ADriver-I shows impressive performance compared to several constructed baselines. We hope our ADriver-I can provide some new insights for future autonomous driving and embodied intelligence.

研究の動機と目的

  • 従来のモジュラーな自律走行パイプラインにおける冗長性と誤差伝搬を克服するため、認識、計画、制御を1つのエンドツーエンドフレームワークに統合すること。
  • 高精細地図や3Dバウンディングボックスに依存せずに、予測された制御信号に基づいて将来のシーンを生成することで、シミュレーテッドワールドにおける自律走行を可能にすること。
  • インタリーブドされた視覚-行動ペアを用いて、自己一貫性があり閉ループな環境で長時間にわたる走行を実現できる汎用的な世界モデルを開発すること。
  • 訓練段階で複数ラウンドの監視を適用することで、逐次的意思決定における累積誤差を低減し、制御信号予測の精度を向上させること。

提案手法

  • 視覚特徴と制御信号(例:ステアリング角度、速度)を1つのテキスト形式のトークンに統合するため、インタリーブドされた視覚-行動ペアを導入し、MLLM処理に適した形式に変換する。
  • マルチモーダル大規模言語モデル(MLLM)を用いて、過去の視覚-行動ペアと現在の視覚トークンに基づき、自己回帰的に現在の制御信号を予測する。
  • 予測された制御信号と過去の視覚-行動ペアを条件として、動画拡散モデル(VDM)を用いて将来の動画フレームを生成する。
  • プロセスを閉ループで繰り返す:予測された制御信号が将来のシーン生成に影響を与え、その結果が次の制御予測にフィードバックされる。
  • 訓練段階で複数ラウンドの会話型監視を適用し、中間の行動予測の精度を向上させ、累積誤差を低減する。
  • MLLMとVDMのコンポーネントを別々に訓練するが、共同フレームワーク内で統合することで、合成世界における自律走行のエンドツーエンドシミュレーションを可能にする。

実験結果

リサーチクエスチョン

  • RQ1MLLMとVDMに基づく統合的世界モデルは、モジュラーパイプラインに依存せずに、正確な制御信号予測を達成できるか?
  • RQ2予測された制御信号に条件づけられた将来のシーン生成は、シミュレーテッド環境における自己一貫性のある自律走行を実現するために効果的か?
  • RQ3訓練段階での複数ラウンドの監視は、逐次的制御信号予測の精度と安定性にどのように影響するか?
  • RQ4高精細地図や3Dバウンディングボックスといった事前知識なしに、モデルはどれほど高精細な将来のフレームを生成できるか?
  • RQ5モデルは、将来の状態と行動を再帰的に生成することで、閉ループ形式で長時間にわたる走行を継続できるか?

主な発見

  • 3つの過去の視覚-行動ペアが与えられた場合、ADriver-Iは速度予測でL1誤差0.072 m/s、ステアリング角度予測でL1誤差0.091 radを達成した。
  • モデルは高精細地図やバウンディングボックスの事前知識なしに、将来4フレームを生成し、Fréchet Video Distance(FVD)が97.0、Fréchet Inception Distance(FID)が5.52と高い品質を示した。
  • 複数ラウンドの監視により、制御予測における累積誤差が低減され、単一ラウンドおよび時系列統合ベースラインを上回る速度およびステアリング角度の精度を達成した。
  • 定性的な結果から、予測された制御信号がシーン生成に直接影響を与え、生成されたシーンが次の行動を導くことが確認され、合成世界における閉ループ自律走行が可能であることが示された。
  • 図7に示すように、モデルは自己生成環境で長時間にわたる走行を成功裏に実行し、シミュレーテッドワールドにおける無限走行の可能性を示した。
  • 強力な性能を発揮している一方で、制御変化が急激な場合の高品質フレーム生成に課題を抱えており、MLLMとVDMの別々の訓練によりエンドツーエンド最適化が制限されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。