Skip to main content
QUICK REVIEW

[論文レビュー] Generating Driving Scenes with Diffusion

Ethan Pronovost, Kai Wang|arXiv (Cornell University)|May 29, 2023
Computer Graphics and Visualization Techniques被引用数 4
ひとこと要約

本論文では、走査画像と拡散を組み合わせた微分可能オートエンコーダー枠組みにおいて、物体検出と組み合わせることで、車両および歩行者の物理的に妥当で向き付きの境界ボックスを直接生成する潜在拡散モデル、Scene Diffusionを提案する。この手法により、地図データを条件とした高品質で多様なシーン生成が可能となり、米国各地域にわたって効果的に一般化され、ヒューリスティック法および自己回帰的ベースラインを上回る現実性と多様性を示す。

ABSTRACT

In this paper we describe a learned method of traffic scene generation designed to simulate the output of the perception system of a self-driving car. In our "Scene Diffusion" system, inspired by latent diffusion, we use a novel combination of diffusion and object detection to directly create realistic and physically plausible arrangements of discrete bounding boxes for agents. We show that our scene generation model is able to adapt to different regions in the US, producing scenarios that capture the intricacies of each region.

研究の動機と目的

  • 自律走行車両のシミュレーションのためのスケーラブルで微分可能な、多様で物理的に妥当な交通シーンを生成する手法の開発。
  • ヒューリスティック法および自己回帰的生成の限界を克服し、地図条件付き拡散からのエージェント配置のエンドツーエンド学習を可能にする。
  • 複数の米国地域における実世界走査シーンの分布をモデル化することで、シナリオの多様性と現実性を向上させる。
  • 後処理を伴わずに直接向き付きの境界ボックスを生成することで、幾何学的および意味的整合性を保証する。
  • 自律走行車両の認識、予測、計画システムの訓練および検証のための高精細シミュレーションを可能にする。

提案手法

  • 条件付き変分オートエンコーダー(CVAE)を訓練し、エージェントのエイジングビュー画像を潜在空間に符号化する。デコーダーは向き付きの境界ボックスを出力する。
  • オートエンコーダーは、予測された境界ボックスパラメータに基づく再構成損失と、潜在分布の安定化のためのKL正則化項を用いる。
  • 潜在拡散モデルをオートエンコーダーの潜在埋め込み上に訓練し、地図画像を条件として、新しいシーン構成を生成する。
  • 拡散モデルは、ノイズ予測用U-Netアーキテクチャを用い、ノイズ除去中に地図特徴にクロスアテンションを適用する。
  • 推論時、拡散モデルが潜在コードを生成し、訓練済みオートエンコーダーのデコーダーを用いて向き付きの境界ボックスに変換する。
  • 地域固有のデータセットを用いて微調整することで、米国各地域の走査環境にわたる一般化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1潜在拡散モデルは、走査シーンにおける構造的・離散的エージェント配置(向き付き境界ボックス)に効果的に適応可能か?
  • RQ2微調整なしで、米国各地域にわたって一般化できるか?
  • RQ3エンドツーエンド微分可能な向き付き境界ボックス生成は、ヒューリスティック法や自己回帰的手法に比べ、現実性と多様性で優れているか?
  • RQ4最小限の後処理で、複雑で物理的に妥当な交通シーンを生成できるか?
  • RQ5物体検出と拡散の組み合わせは、占有マップベースのGANと比較して、シーン生成品質をどのように向上させるか?

主な発見

  • Scene Diffusionモデルは、複数の米国地域にわたって多様で現実的な走査シーンを物理的に妥当なエージェント配置とともに効果的に生成した。
  • 定性的な評価から、モデルが生成するシーンは地域固有の走行行動とインfra構造パターンを的確に捉えていることが示された。
  • 微調整なしで未学習地域に一般化できることから、潜在的なシーン分布の堅牢な学習が行われていることが示された。
  • 定量的評価から、自己回帰的およびGANベースのベースラインと比較して、シーンの多様性と現実性で優れた性能を示した。
  • エンドツーエンド微分可能なアーキテクチャにより、後処理ステップなしに安定した学習と高精細な生成が可能になった。
  • 方向角にサインおよびコサインエンコーディングを用いることで、角度の不連続性が回避され、検出精度が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。