Skip to main content
QUICK REVIEW

[論文レビュー] OccNeRF: Advancing 3D Occupancy Prediction in LiDAR-Free Environments

Chubin Zhang, Juncheng Yan|arXiv (Cornell University)|Dec 14, 2023
Video Surveillance and Tracking Methods被引用数 7
ひとこと要約

OccNeRFは、LiDARを用いない自己教師ありマルチカメラ3D占有予測のための手法を提案する。神経放射場を用いて生画像から深度マップをレンダリングし、写真的一致性を幾何的監視に用いる。nuScenesデータセットにおいて自己教師あり深度推定でSOTA性能を達成し、セマンティック占有予測でも競争力ある結果を示す。無限大のシーンを扱えるパラメトリック座標系と、オープンボリューム分類のための洗練されたプロンプト戦略を活用する。

ABSTRACT

Occupancy prediction reconstructs 3D structures of surrounding environments. It provides detailed information for autonomous driving planning and navigation. However, most existing methods heavily rely on the LiDAR point clouds to generate occupancy ground truth, which is not available in the vision-based system. In this paper, we propose an OccNeRF method for training occupancy networks without 3D supervision. Different from previous works which consider a bounded scene, we parameterize the reconstructed occupancy fields and reorganize the sampling strategy to align with the cameras' infinite perceptive range. The neural rendering is adopted to convert occupancy fields to multi-camera depth maps, supervised by multi-frame photometric consistency. Moreover, for semantic occupancy prediction, we design several strategies to polish the prompts and filter the outputs of a pretrained open-vocabulary 2D segmentation model. Extensive experiments for both self-supervised depth estimation and 3D occupancy prediction tasks on nuScenes and SemanticKITTI datasets demonstrate the effectiveness of our method.

研究の動機と目的

  • LiDAR点群に依存せずにビジョン中心の自動運転システムにおける自己教師あり3D占有予測を可能にすること。
  • 生RGB画像を用いた自己教師あり3D占有学習における無限大シーン表現の課題に対処すること。
  • パラメトリックな占有フィールドをマルチカメラ深度マップに変換する微分可能レンダリングパイプラインを構築し、写真的一致性による幾何的監視を実現すること。
  • 事前学習済みオープンボリューム分類モデルのプロンプトを洗練させ、それを占有ヘッドと統合することでセマンティック占有予測を向上させること。
  • 自己教師あり設定下で、nuScenesベンチマークを用いて深度推定およびセマンティック占有予測の両方において手法を検証すること。

提案手法

  • 無限大の空間を有界な体積に写像する収縮座標系を用いて3D占有フィールドをパラメトリックに定式化し、内部と外部の領域を異なる座標変換で分離する。
  • パラメトリックな占有フィールドから3Dポイントを効率的にサンプリングし、神経レンダリングを用いてマルチカメラ深度マップにレンダリングするための特別なサンプリング戦略を設計する。
  • 時間的写真的一致性をマルチフレームシーケンス全体にわたって用い、LiDARベースの監視を置き換える主な幾何的監視信号とする。
  • 事前学習済みオープンボリューム分類モデル(Grounding DINO)を洗練されたプロンプト戦略と統合し、セマンティック占有監視用の2Dセマンティックラベルを生成する。
  • 写真的一致性による深度推定とクロスエントロピーによるセマンティックラベルの両方を組み合わせたマルチタスク損失を用いて、エンドツーエンドの自己教師あり学習を実行する。
  • 計算コストの高いクロスビュー注意機構を回避するため、2D特徴を直接3D空間に補間する軽量な3D特徴集約モジュールを採用する。

実験結果

リサーチクエスチョン

  • RQ1マルチカメラRGB画像のみを用いてLiDAR監視なしに自己教師あり3D占有予測を効果的に達成できるか?
  • RQ2神経放射場ベースのフレームワークにおいて、無限大の3Dシーンを効果的に表現・最適化できるか?
  • RQ3時間的写真的一致性のみで、自己教師あり設定下で高品質な深度推定に十分な幾何的監視を提供できるか?
  • RQ4マニュアルアノテーションなしに、オープンボリューム分類モデルを効果的に変換し、信頼性の高いセマンティックラベルを3D占有予測に生成できるか?
  • RQ53Dセマンティック占有予測の文脈において、オープンボリュームモデルの性能を最大化するためのプロンプト工学戦略は何か?

主な発見

  • OccNeRFは、nuScenesデータセットにおいて自己教師ありマルチカメラ深度推定でSOTA性能を達成し、フロントカメラでAbs Relが0.132を記録し、先行手法を上回った。
  • 特にサイドビューカメラにおいて顕著な改善が見られ、F.LeftでAbs Relが0.190、B.Leftで0.204を記録し、困難な視点にも対応できる堅牢性を示した。
  • セマンティック占有予測においては、洗練されたプロンプト戦略を用いた場合、完全教師あり手法と比較しても競争力ある性能を達成した。
  • アブレーションスタディにより、この設定下で時間的写真的一致損失が直接画像再構成損失よりも幾何的監視に有効であることが確認された。
  • 提案された座標収縮とサンプリング戦略により、無限大シーンの効果的モデリングが可能となり、一般化性能が著しく向上し、レンダリング深度マップのアーチファクトが減少した。
  • 定性的な比較では、OccNeRFは先行手法と比較して、特にオクルージョンや複雑な都市環境において、より少ないアーチファクトとより正確な深度マップを生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。