Skip to main content
QUICK REVIEW

[論文レビュー] PeRFception: Perception using Radiance Fields

Yoonwoo Jeong, Seungjoo Shin|arXiv (Cornell University)|Aug 24, 2022
Advanced Vision and Imaging被引用数 6
ひとこと要約

本論文では、Plenoxelsに基づく大規模な暗黙的3D表現データセットであるPeRFceptionを紹介する。Plenoxelsは、メモリ効率の良い形式で2Dおよび3D情報を統合的に符号化した、圧縮され、写真同等のリアルな放射場である。著者らは、この暗黙的表現上で分類およびセグメンテーションモデルを直接エンドツーエンドで訓練できることを示し、96.4%のメモリ圧縮率と、新たな背景拡張技術を達成した。

ABSTRACT

The recent progress in implicit 3D representation, i.e., Neural Radiance Fields (NeRFs), has made accurate and photorealistic 3D reconstruction possible in a differentiable manner. This new representation can effectively convey the information of hundreds of high-resolution images in one compact format and allows photorealistic synthesis of novel views. In this work, using the variant of NeRF called Plenoxels, we create the first large-scale implicit representation datasets for perception tasks, called the PeRFception, which consists of two parts that incorporate both object-centric and scene-centric scans for classification and segmentation. It shows a significant memory compression rate (96.4\%) from the original dataset, while containing both 2D and 3D information in a unified form. We construct the classification and segmentation models that directly take as input this implicit format and also propose a novel augmentation technique to avoid overfitting on backgrounds of images. The code and data are publicly available in https://postech-cvlab.github.io/PeRFception .

研究の動機と目的

  • NeRFのような暗黙的3D表現のための大規模データセットの不足に対処する。
  • 認識タスクにおけるNeRFの速度、特徴の一貫性、および移植可能性の制限を克服する。
  • 分類やセグメンテーションなどの下流認識タスクにおいて、暗黙的表現(Plenoxels経由)を直接処理できるようにする。
  • 幾何学的および写真同等のリアルな情報を両方保持する、統一的でコンactかつ一貫性のある特徴表現を開発する。
  • 過学習を軽減するための、新たな背景拡張戦略を導入する。

提案手法

  • 微分可能なボリュメトリックレンダリングを用いて、2つの大規模3Dデータセット(CO3DおよびScanNet)をPlenoxelベースの暗黙的表現に変換する。
  • 球面調和係数とスパースボクセルグリッドを用いて、視点依存の放射場と幾何を符号化し、シーン間で一貫性があり構造的な特徴を実現する。
  • データ圧縮技術を適用して、Plenoxelのサイズを96.4%まで削減しながら、高精度な再構成と認識性能を維持する。
  • 訓練中に背景のビューを操作する新たな拡張法を設計し、一般化性能を向上させ、過学習を低減する。
  • エンドツーエンドで2D画像分類、3Dオブジェクト分類、3Dセマンティックセグメンテーションモデルを、暗黙的Plenoxel形式上で直接訓練する。
  • 明示的なスパースボクセルグリッドを活用して、標準的なNeRFと比較して推論を高速化し、効率的な特徴抽出を可能にする。

実験結果

リサーチクエスチョン

  • RQ1Plenoxelsのような暗黙的3D表現が、多様な認識タスクの統一入力フォーマットとして効果的に使用可能かどうか。
  • RQ2Plenoxel表現のメモリ圧縮が、下流の認識性能に及ぼす影響の程度は。
  • RQ3暗黙的空間における背景拡張が、分類およびセグメンテーションモデルの一般化性能をどのように向上させるか。
  • RQ4直接暗黙的表現上で訓練されたエンドツーエンドモデルが、明示的3D入力を用いたものと比較して競争力のある正確性を達成できるか。
  • RQ5Plenoxelsにおける構造的特徴表現が、異なるシーン間で一貫性があり移植可能な認識をどのように支援するか。

主な発見

  • PeRFceptionデータセットは、元のデータセットと比較して96.4%のメモリ圧縮率を達成しながら、写真同等のレンダリング品質と3D幾何的忠実度を維持している。
  • PeRFception-CO3D上で直接訓練された分類モデルは、14Aでトップ1正答率85.3%を達成し、最良の拡張設定下で34Cでは46.6%の正答率を示した。
  • PeRFception-ScanNet上のセマンティックセグメンテーションモデルは、34C設定で92.7%の平均IoUを達成し、複雑な屋内シーンにおける強力な一般化性能を示した。
  • 提案された背景拡張技術は、過学習を顕著に低減させ、特定のクラスでは正答率を最大4.5%向上させた。
  • 暗黙的表現上でエンドツーエンドで訓練した結果、2Dおよび3D認識タスクの両方で競争力ある性能が得られ、直接的な暗黙的入力処理の可能性が裏付けられた。
  • 可視化結果から、高精度な新規ビュー合成と正確なセマンティックラベル付けが確認され、誤差マップのPSNRが30を超えるなど、優れた再構成品質を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。