Skip to main content
QUICK REVIEW

[論文レビュー] Neural Sparse Voxel Fields

Lingjie Liu, Jiahua Gu|arXiv (Cornell University)|Jul 22, 2020
Generative Adversarial Networks and Image Synthesis参考文献 46被引用数 13
ひとこと要約

Neural Sparse Voxel Fields (NSVF) は、高精度で高速な自由視点レンダリングを実現するため、局所的な暗黙的フィールドをスパースボクセルオクソリに整理するハイブリッドニューラルシーン表現を提案する。スパースボクセル頂点におけるボクセル埋め込みの学習と微分可能なレイマーチングを採用することで、NeRF よりも 10 倍以上高速な推論を達成するとともに、品質の高い、シャープなレンダリングを生成し、編集可能性と動的・大規模シーンへのスケーラビリティが向上する。

ABSTRACT

Photo-realistic free-viewpoint rendering of real-world scenes using classical computer graphics techniques is challenging, because it requires the difficult step of capturing detailed appearance and geometry models. Recent studies have demonstrated promising results by learning scene representations that implicitly encode both geometry and appearance without 3D supervision. However, existing approaches in practice often show blurry renderings caused by the limited network capacity or the difficulty in finding accurate intersections of camera rays with the scene geometry. Synthesizing high-resolution imagery from these representations often requires time-consuming optical ray marching. In this work, we introduce Neural Sparse Voxel Fields (NSVF), a new neural scene representation for fast and high-quality free-viewpoint rendering. NSVF defines a set of voxel-bounded implicit fields organized in a sparse voxel octree to model local properties in each cell. We progressively learn the underlying voxel structures with a differentiable ray-marching operation from only a set of posed RGB images. With the sparse voxel octree structure, rendering novel views can be accelerated by skipping the voxels containing no relevant scene content. Our method is typically over 10 times faster than the state-of-the-art (namely, NeRF(Mildenhall et al., 2020)) at inference time while achieving higher quality results. Furthermore, by utilizing an explicit sparse voxel representation, our method can easily be applied to scene editing and scene composition. We also demonstrate several challenging tasks, including multi-scene learning, free-viewpoint rendering of a moving human, and large-scale scene rendering. Code and data are available at our website: https://github.com/facebookresearch/NSVF.

研究の動機と目的

  • 既存のニューラル暗黙的表現の限界、たとえば濃密なボリュメトリックサンプリングとネットワーク容量の制限によるぼやけたレンダリングや遅い推論を解消すること。
  • 明示的な 3D 監督なしに、撮影位置がわかっている 2D RGB 画像のみから、効率的で高解像度の新規ビュー合成を可能にすること。
  • 明示的なスパースボクセル構造を活用して、実用的なシーン編集とコンpositing を可能にすること。
  • 動的シーンや大規模シーンへのスケーリングを可能にし、移動中の人物やマルチシーン学習に対応すること。
  • スパースボクセルオクソリ上で微分可能な段階的学習戦略を用いて、空のボクセルをスキップすることでレンダリングを高速化すること。

提案手法

  • NSVF は、シーンをスパースボクセルオクソリで構成し、各アクティブなボクセルはその 8 個の頂点に学習済み埋め込みを格納して局所的な幾何と外観を表現する。
  • マルチレイヤーパーセプトロン (MLP) がボクセル頂点埋め込みを統合し、ボクセル内の任意のクエリポイントの色と密度を予測する。
  • 微分可能なレイマーチング操作を採用することで、撮影位置がわかっている 2D 画像からのエンドツーエンドの学習が可能になり、段階的にスパースボクセル構造を精錬する。
  • 訓練中は、シーンコンテンツのないボクセルが pruning され、ネットワークが実際に幾何と外観を持つ領域に集中できる。
  • 推論時には、空のボクセルをスキップすることでレンダリングが高速化され、計算時間が顕著に削減される。
  • スパースボクセル構造により、特定のボクセル領域に局所的に変更を加えることで、効率的なシーン編集とコンポジティングが可能になる。

実験結果

リサーチクエスチョン

  • RQ1スパースボクセルベースのニューラル表現は、NeRF らしい濃密な暗黙的表現よりも、より高いレンダリング品質と高速な推論を達成できるか?
  • RQ2スパースボクセルオクソリ上で微分可能なレイマーチングを用いることで、3D 監督なしに 2D 画像のみから段階的かつエンドツーエンドの学習が可能になるか?
  • RQ3明示的なスパースボクセル構造は、実用的なシーン編集やコンポジティングタスクをサポートできるか?
  • RQ4NSVF は、動的シーン、マルチシーン学習、大規模環境といった挑戦的なシナリオにスケーリングできるか?
  • RQ5ボクセルバウンデッドな暗黙的フィールド設計は、標準的なニューラル暗黙的関数と比較して、ぼやけを低減し、幾何的正確性を向上させるか?

主な発見

  • NSVF は、最先端の NeRF メソッドよりも 10 倍以上高速な推論速度を達成するとともに、品質の高い、シャープなレンダリングを生成する。
  • 本手法は、より良いネットワーク容量の割り当てと正確なレイ-ジオメトリ交差を実現することで、ぼやけの少ない優れたレンダリング品質を示す。
  • 空のボクセルをスキップすることで、NSVF は視覚的忠実度を損なわずに顕著な高速化を実現する、効率的なレンダリングを可能にする。
  • 本手法は、移動中の人物の自由視点レンダリングや、1組の画像セットからの大規模シーン再構築といった複雑なタスクをサポートする。
  • スパースボクセル構造により、特定のシーン領域の操作が直感的に行えるため、効果的なシーン編集とコンポジティングが可能になる。
  • 本手法はマルチシーン学習にうまく一般化され、多様な屋内・屋外シーンにおいて高いパフォーマンスを維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。