Skip to main content
QUICK REVIEW

[論文レビュー] GeoSim: Realistic Video Simulation via Geometry-Aware Composition for Self-Driving

Yun Chen, Frieda Rong|arXiv (Cornell University)|Jan 16, 2021
Computer Graphics and Visualization Techniques参考文献 60被引用数 4
ひとこと要約

GeoSimは、センサデータから抽出したリアルな3D動的オブジェクトを、新しいポーズでレンダリングし、既存の都市環境に合成することで、写真のようにリアルで幾何学的に整合性があり、交通状況に配慮した合成動画を生成する幾何学的注意型の動画シミュレーションフレームワークを提案する。本手法は、データ拡張による性能向上により、知覚品質をSOTA水準に高め、セマンティックセグメンテーションのmIOUを3.4%向上させる。

ABSTRACT

Scalable sensor simulation is an important yet challenging open problem for safety-critical domains such as self-driving. Current works in image simulation either fail to be photorealistic or do not model the 3D environment and the dynamic objects within, losing high-level control and physical realism. In this paper, we present GeoSim, a geometry-aware image composition process which synthesizes novel urban driving scenarios by augmenting existing images with dynamic objects extracted from other scenes and rendered at novel poses. Towards this goal, we first build a diverse bank of 3D objects with both realistic geometry and appearance from sensor data. During simulation, we perform a novel geometry-aware simulation-by-composition procedure which 1) proposes plausible and realistic object placements into a given scene, 2) render novel views of dynamic objects from the asset bank, and 3) composes and blends the rendered image segments. The resulting synthetic images are realistic, traffic-aware, and geometrically consistent, allowing our approach to scale to complex use cases. We demonstrate two such important applications: long-range realistic video simulation across multiple camera sensors, and synthetic data generation for data augmentation on downstream segmentation tasks. Please check https://tmux.top/publication/geosim/ for high-resolution video results.

研究の動機と目的

  • 自己走行システム向けにスケーラブルで写真的であり、物理的に整合性のある動画シミュレーションの不足を解消すること。
  • 大規模なセンサデータを活用することで、手作業による3Dアセット作成の必要性を排除すること。
  • 適切な隠蔽、照明、空間的一致性を備えた、動的オブジェクト(例:車両)を既存シーンにリアルに挿入できること。
  • 合成データの有効性を、セマンティックセグメンテーションなどの下流の認識タスクにおける性能向上を通じて示すこと。
  • 複数のカメラセンサをカバーする動画シミュレーションにおいて、高いリアリズムと幾何学的正確性を実現すること。

提案手法

  • 形状正則化を施した微分可能再構築ネットワークを用いて、マルチビュー・マルチセンサデータ(LiDAR、カメラ)から大規模な3Dアセットバンクを構築する。
  • HDマップとLiDARを活用して、交通状況に配慮した物理的に妥当な3Dオブジェクトの配置を推定し、シーン内での配置を保証する。
  • 画像ベースレンダリングとニューラルインpaintingを組み合わせ、隠蔽、照明の変動、境界のブレンドを適切に処理し、シームレスな合成を実現する。
  • 物理ベースレンダリングとニューラルインpaintingをハイブリッドに組み合わせたレンダリングパイプラインを採用し、リアリズムを高めつつも効率性を維持する。
  • オブジェクトポーズの伝搬と新規ビューのレンダリングにより、複数のカメラセンサ間で時間的に整合性のある動画シーケンスを生成する。
  • 合成データをデータ拡張に活用し、実データに合成例を追加することで、セマンティックセグメンテーションのモデルを微調整する。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型で幾何学的注意型の合成手法は、人間の知覚では実写映像と区別がつかない合成ドライブ動画を生成できるか?
  • RQ23Dシーンレイアウトと動的オブジェクト配置の統合は、動画シミュレーションにおけるリアリズムと幾何学的一致性をどの程度向上させるか?
  • RQ3GeoSimが生成する合成データは、セマンティックセグメンテーションのような下流の認識モデルの性能をどの程度向上できるか?
  • RQ4FIDスコアの改善が限定的であるにもかかわらず、影のレンダリングとハイブリッドレンダリングの相対的寄与度は、知覚的リアリズムにどの程度影響を与えるか?
  • RQ5再トレーニングなしで、GeoSimは異なるデータセットや都市環境に一般化可能か?

主な発見

  • 人間の好み評価において、GeoSimは、SPADE、Guided Editing、CADなどのベースラインと比較して94.3%の高いスコアを達成し、顕著に優れている。
  • GeoSimのFIDスコアは14.3であり、すべてのベースラインを下回っており、実データとの分布的類似性が優れていることを示している。
  • レンダリングパイプラインに影を組み込むことで、人間の好みは71.9%から向上した(明示的改善)。FIDスコアは14.3のまま変化せず、人間の知覚とFID指標の間にはギャップがあることを示している。
  • Argoverseデータセットにおいて、GeoSimはCADを上回る84.0%の好みスコアを達成し、FIDは24.5であった。これは、異なるデータセット間での優れた一般化性能を示している。
  • GeoSimを用いたデータ拡張により、PSPNetではmIOUが3.4%向上、DeepLabv3では0.4%向上し、2つのセグメンテーションモデルで一貫した向上が得られた。
  • 従来手法で見られた、ぼやけた車両や幾何学的不整合といったアーティファクトを低減し、ニューラルインpaintingと隠蔽処理により、滑らかでシームレスなブレンドを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。