[論文レビュー] PeRFception: Perception using Radiance Fields
本論文では、Plenoxelsに基づく大規模な暗黙的3D表現データセットであるPeRFceptionを紹介する。Plenoxelsは、メモリ効率の良い形式で2Dおよび3D情報を統合的に符号化した、圧縮され、写真同等のリアルな放射場である。著者らは、この暗黙的表現上で分類およびセグメンテーションモデルを直接エンドツーエンドで訓練できることを示し、96.4%のメモリ圧縮率と、新たな背景拡張技術を達成した。
The recent progress in implicit 3D representation, i.e., Neural Radiance Fields (NeRFs), has made accurate and photorealistic 3D reconstruction possible in a differentiable manner. This new representation can effectively convey the information of hundreds of high-resolution images in one compact format and allows photorealistic synthesis of novel views. In this work, using the variant of NeRF called Plenoxels, we create the first large-scale implicit representation datasets for perception tasks, called the PeRFception, which consists of two parts that incorporate both object-centric and scene-centric scans for classification and segmentation. It shows a significant memory compression rate (96.4\%) from the original dataset, while containing both 2D and 3D information in a unified form. We construct the classification and segmentation models that directly take as input this implicit format and also propose a novel augmentation technique to avoid overfitting on backgrounds of images. The code and data are publicly available in https://postech-cvlab.github.io/PeRFception .
研究の動機と目的
- NeRFのような暗黙的3D表現のための大規模データセットの不足に対処する。
- 認識タスクにおけるNeRFの速度、特徴の一貫性、および移植可能性の制限を克服する。
- 分類やセグメンテーションなどの下流認識タスクにおいて、暗黙的表現(Plenoxels経由)を直接処理できるようにする。
- 幾何学的および写真同等のリアルな情報を両方保持する、統一的でコンactかつ一貫性のある特徴表現を開発する。
- 過学習を軽減するための、新たな背景拡張戦略を導入する。
提案手法
- 微分可能なボリュメトリックレンダリングを用いて、2つの大規模3Dデータセット(CO3DおよびScanNet)をPlenoxelベースの暗黙的表現に変換する。
- 球面調和係数とスパースボクセルグリッドを用いて、視点依存の放射場と幾何を符号化し、シーン間で一貫性があり構造的な特徴を実現する。
- データ圧縮技術を適用して、Plenoxelのサイズを96.4%まで削減しながら、高精度な再構成と認識性能を維持する。
- 訓練中に背景のビューを操作する新たな拡張法を設計し、一般化性能を向上させ、過学習を低減する。
- エンドツーエンドで2D画像分類、3Dオブジェクト分類、3Dセマンティックセグメンテーションモデルを、暗黙的Plenoxel形式上で直接訓練する。
- 明示的なスパースボクセルグリッドを活用して、標準的なNeRFと比較して推論を高速化し、効率的な特徴抽出を可能にする。
実験結果
リサーチクエスチョン
- RQ1Plenoxelsのような暗黙的3D表現が、多様な認識タスクの統一入力フォーマットとして効果的に使用可能かどうか。
- RQ2Plenoxel表現のメモリ圧縮が、下流の認識性能に及ぼす影響の程度は。
- RQ3暗黙的空間における背景拡張が、分類およびセグメンテーションモデルの一般化性能をどのように向上させるか。
- RQ4直接暗黙的表現上で訓練されたエンドツーエンドモデルが、明示的3D入力を用いたものと比較して競争力のある正確性を達成できるか。
- RQ5Plenoxelsにおける構造的特徴表現が、異なるシーン間で一貫性があり移植可能な認識をどのように支援するか。
主な発見
- PeRFceptionデータセットは、元のデータセットと比較して96.4%のメモリ圧縮率を達成しながら、写真同等のレンダリング品質と3D幾何的忠実度を維持している。
- PeRFception-CO3D上で直接訓練された分類モデルは、14Aでトップ1正答率85.3%を達成し、最良の拡張設定下で34Cでは46.6%の正答率を示した。
- PeRFception-ScanNet上のセマンティックセグメンテーションモデルは、34C設定で92.7%の平均IoUを達成し、複雑な屋内シーンにおける強力な一般化性能を示した。
- 提案された背景拡張技術は、過学習を顕著に低減させ、特定のクラスでは正答率を最大4.5%向上させた。
- 暗黙的表現上でエンドツーエンドで訓練した結果、2Dおよび3D認識タスクの両方で競争力ある性能が得られ、直接的な暗黙的入力処理の可能性が裏付けられた。
- 可視化結果から、高精度な新規ビュー合成と正確なセマンティックラベル付けが確認され、誤差マップのPSNRが30を超えるなど、優れた再構成品質を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。