Skip to main content
QUICK REVIEW

[論文レビュー] OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving

Wenzhao Zheng, Weiliang Chen|arXiv (Cornell University)|Nov 27, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

OccWorldは、自己教師付き学習を用いて3次元セマンティック占有状態から、将来のシーン進化とエゴ車両の軌道を同時に予測する3次元占有世界モデルを提案する。VQ-VAEトークナイザーと空間時間的生成変換器を採用し、離散的なシーンおよびエゴトークンを予測することで、自己教師付き学習による状態推定を実現し、インスタンスや地図の教師なし条件下でも、4次元占有状態予測(mIoU 17.13)と競争力ある計画性能(L2誤差 1.16)を達成した。

ABSTRACT

Understanding how the 3D scene evolves is vital for making decisions in autonomous driving. Most existing methods achieve this by predicting the movements of object boxes, which cannot capture more fine-grained scene information. In this paper, we explore a new framework of learning a world model, OccWorld, in the 3D Occupancy space to simultaneously predict the movement of the ego car and the evolution of the surrounding scenes. We propose to learn a world model based on 3D occupancy rather than 3D bounding boxes and segmentation maps for three reasons: 1) expressiveness. 3D occupancy can describe the more fine-grained 3D structure of the scene; 2) efficiency. 3D occupancy is more economical to obtain (e.g., from sparse LiDAR points). 3) versatility. 3D occupancy can adapt to both vision and LiDAR. To facilitate the modeling of the world evolution, we learn a reconstruction-based scene tokenizer on the 3D occupancy to obtain discrete scene tokens to describe the surrounding scenes. We then adopt a GPT-like spatial-temporal generative transformer to generate subsequent scene and ego tokens to decode the future occupancy and ego trajectory. Extensive experiments on the widely used nuScenes benchmark demonstrate the ability of OccWorld to effectively model the evolution of the driving scenes. OccWorld also produces competitive planning results without using instance and map supervision. Code: https://github.com/wzzheng/OccWorld.

研究の動機と目的

  • 高価なインスタンスレベルおよび地図のアノテーションに依存する従来の認識予測計画パイプラインの限界を克服すること。
  • 物体のボクセルボックスを越えて、空間的・時間的細分化された理解を備えた3次元ドライブシーンの進化をモデル化すること。
  • 入力として3次元占有状態のみを用いて、将来の占有状態とエゴ軌道の両方を予測する自己教師付き世界モデルを開発すること。
  • インスタンスや地図の教師なし条件下でも解釈可能でエンドツーエンドの自律走行を可能にすること。
  • 3次元占有状態が、ボクセルボックスやセグメンテーションマップと比較して、より表現力があり、効率的で多様性に富んだ世界モデル表現であることを示すこと。

提案手法

  • 3次元セマンティック占有状態から離散的シーントークナイザーを自己教師付き表現学習可能に学習するため、ベクトル量子化変分オートエンコーダ(VQ-VAE)が用いられる。
  • 空間時間的生成変換器が提案され、まず空間混合を適用してマルチスケールのシーントークンを集約し、次に時間注意機構を用いて系列の進化をモデル化することで、将来のシーンおよびエゴトークンを自己回帰的に予測する。
  • 空間混合モジュールは、階層的なシーン構造を捉えるために、空間レベル across でシーントークンを集約し、特徴表現を向上させる。
  • 時間注意機構は、異なる空間レベルのトークンに適用され、時間的依存性をモデル化し、次のフレームのトークンを予測する。
  • U-Netベースのデコーダーは、予測されたシーントークンから将来の3次元占有状態を再構築する。別個のトラジェクトリーデコーダーはエゴモーション予測を生成する。
  • 地上真値のボクセルボックスやHDマップが不要な状態で、再構築および将来予測の目的関数を用いてエンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1インスタンスや地図の教師なし条件下で、自己教師付き3次元占有状態世界モデルが、将来のシーン進化とエゴ軌道を効果的に予測できるか?
  • RQ23次元占有状態空間におけるシーン進化のモデリングは、従来の3次元ボクセルボックスを用いた方法と比較して、精度および表現力の面で優れているか?
  • RQ3シーンとエゴ軌道の共同モデリングが、予測および計画性能に与える影響は何か?
  • RQ4空間混合や時間注意といったアーキテクチャ的要素が、将来の占有状態および軌道予測能力に与える影響は何か?
  • RQ53次元占有状態は、エンドツーエンドの自律走行のための普遍的で効率的かつ多様性に富んだ表現として使用可能か?

主な発見

  • 2秒の履歴をもとに3秒先の4次元占有状態予測において、平均交差率(mIoU)が17.13に達し、優れたシーン進化予測性能を示した。
  • インスタンスや地図の教師なし条件下でも、エゴ軌道予測のL2誤差が1.16に留まり、競争力ある計画性能を示した。
  • 真値の3次元占有状態を使用するOccWorld-Oは、地図やボックスの教師なし条件下で、OccNet(認識予測計画パイプライン)を大きく上回った。
  • アブレーションスタディにより、空間集約と時間注意が、4次元占有状態予測および運動計画の両方にとって不可欠であることが確認され、それらを削除すると性能が著しく低下した。
  • 一部のケースでは、OccWorldは真値よりも現実的なかけ離れた走行領域を生成しており、学習データを記憶するのではなく、シーンの意味を学習していることを示している。
  • 入力履歴に存在しない新たな車両の出現予測に困難を示しており、一般化の鍵となる課題が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。