Skip to main content
QUICK REVIEW

[論文レビュー] SceneGen: Learning to Generate Realistic Traffic Scenes

Shuhan Tan, Kelvin Wong|arXiv (Cornell University)|Jan 16, 2021
Autonomous Vehicle Technology and Safety参考文献 23被引用数 6
ひとこと要約

SceneGenは、走行可能なマップとエゴ車両状態を条件として、現実的で多様かつ意味的に整合性のある交通シーンを合成するための深層生成モデルを提案する。ConvLSTMを用いたアーキテクチャと、アクタークラス、位置、サイズ、向きに関する条件付き分布を用い、高い現実性と多様性を持つシーンを生成する。MMD指標においてベースラインを上回り、三方向転回や複雑な歩行者横断といったレアだが現実的な交通行動を示す。

ABSTRACT

We consider the problem of generating realistic traffic scenes automatically. Existing methods typically insert actors into the scene according to a set of hand-crafted heuristics and are limited in their ability to model the true complexity and diversity of real traffic scenes, thus inducing a content gap between synthesized traffic scenes versus real ones. As a result, existing simulators lack the fidelity necessary to train and test self-driving vehicles. To address this limitation, we present SceneGen, a neural autoregressive model of traffic scenes that eschews the need for rules and heuristics. In particular, given the ego-vehicle state and a high definition map of surrounding area, SceneGen inserts actors of various classes into the scene and synthesizes their sizes, orientations, and velocities. We demonstrate on two large-scale datasets SceneGen's ability to faithfully model distributions of real traffic scenes. Moreover, we show that SceneGen coupled with sensor simulation can be used to train perception models that generalize to the real world.

研究の動機と目的

  • 自律走行シミュレーションのためのデータ駆動型生成モデルを開発し、現実的で多様な交通シーンを合成すること。
  • 単純なヒューリスティクスをはるかに超える複雑で多様な交通行動をモデル化すること。特に、三方向転回や共有レーンでの横断といったまれだが現実的な動きを含むこと。
  • アクター属性におけるカテゴリカル分布および混合分布を用いた不確実性モデリングを統合することで、シーンレベルの現実性を向上させること。
  • 静的HDマップとエゴ車両状態を条件として、シミュレーションやトレーニングタスクに適した制御可能な交通シーン生成を可能にすること。

提案手法

  • 320×320のベーシックビュー入力表現を用い、HDマップ要素(レーン、走行可能領域、横断歩道)、信号、速度制限、およびアクター状態(位置、向き、速度)をマルチチャネルラスタライズド形式で符号化する。
  • 2層のConvLSTM(32個の隠れチャネル、5×5カーネル)を用いて時空間的シーンコンテキストを符号化し、その後に5層のCNNバックボーンを用いて特徴抽出を実施する。
  • アクター属性を条件付き確率分布により予測:クラスは3層のMLPとソフトマックス出力を用い、位置は0.25mグリッドセル上の均一量子化とカテゴリカル分布を用いる。
  • ボクシングボックスの寸法は、K個の2次元対数正規分布の混合を用い、パラメータは対数分散および相関項を含む3層のMLPで予測し、正定値共分散を保証する。
  • 向きの角度は、K個のVon-Mises分布の混合を用い、別個のMLPでパラメータを予測することで、円形分布モデリングを可能にする。
  • リアルさの向上を図るため、核サンプリングに類似した戦略を採用。1ステップあたりM個の候補を生成し、その中から尤もらしいものを選択する。
Figure 1 : The input multi-channel image to SceneGen for ATG4D.
Figure 1 : The input multi-channel image to SceneGen for ATG4D.

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、ヒューリスティクスでは容易にモデル化できない複雑で多様な行動を捉えた、現実的で多様な交通シーンを生成できるか?
  • RQ2学習モデルは、三方向転回や共有レーンでの移動といったまれだが現実的な交通シナリオにどの程度一般化できるか?
  • RQ3サンプル候補数Mが、特にシーンレベル統計の観点から、生成シーンのリアルさと多様性に与える影響は何か?
  • RQ4モデルは、横断歩道における分散的分布やレーン中央線に沿った集中配置といった、アクター配置の空間的不確実性を正確に表現できるか?
  • RQ5モデルは、ヒューリスティクスベースおよび他の学習ベースのベースラインと比較して、現実世界の交通シーンの統計的分布をどの程度正確に捉えられるか?

主な発見

  • SceneGenは、ATG4DおよびArgoverseベンチマークの両方で、比較対象のすべての手法と比較して、最小のFrechet Motion Distance(FMD)とマルチスケール構造的類似性(MSSIM)を達成した。
  • ATG4Dでは、車両のみのシーン統計においてMMDが0.042を記録し、MetaSim(0.071)とLane Graph(0.063)を大きく上回り、アクターレベルの分布における優れたリアルさを示した。
  • M=20の候補数を用いることで、深層特徴におけるMMDがM=1と比較して15%低減された。これは、サンプリングの増加がシーンレベルのリアルさを向上させ、モード崩壊を軽減することを示している。
  • 定性的な結果から、SceneGenは三方向転回や自転車が車線を用いた左折といった、レアだが現実的な行動を生成している。これらの行動はベースラインモデルには存在しない。
  • モデルは生成における高い多様性を示している:同じ入力(SDV状態とマップ)から複数のサンプルを生成すると、歩行者が横断する、保護なしの左折、交差点でバスがまっすぐ進むといった異なる構成が得られる。
  • ヒートマップの可視化により、モデルが意味のある空間的不確実性を学習していることが確認された:車両の位置はレーン中央線に集中し、歩行者の位置は歩道や横断歩道にわたって分散している。
Figure 2 : Traffic scenes generated by SceneGen using $M=1,10,20$ sample proposals for ATG4D.
Figure 2 : Traffic scenes generated by SceneGen using $M=1,10,20$ sample proposals for ATG4D.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。