Skip to main content
QUICK REVIEW

[論文レビュー] D-TensoRF: Tensorial Radiance Fields for Dynamic Scenes

Hankyu Jang, Dae-Young Kim|arXiv (Cornell University)|Dec 5, 2022
Advanced Vision and Imaging被引用数 9
ひとこと要約

D-TensoRF は、空間(X, Y, Z)と時間(t)の次元を含む 5 次元テンソルとして放射場をモデル化し、CP または行列-行列(MM)分解を用いて低ランク因子分解を行うことで、動的 3D シーン向けのコン pact で高速なテンソリアルレディアンスフィールドを提案する。滑らかさ正則化を用いて変形ネットワークを用いずに時間的整合性を確保することで、16 分未満の学習時間と最小 1.8 MB のモデルサイズで最先端の知覚的品質を達成する。

ABSTRACT

Neural radiance field (NeRF) attracts attention as a promising approach to reconstructing the 3D scene. As NeRF emerges, subsequent studies have been conducted to model dynamic scenes, which include motions or topological changes. However, most of them use an additional deformation network, slowing down the training and rendering speed. Tensorial radiance field (TensoRF) recently shows its potential for fast, high-quality reconstruction of static scenes with compact model size. In this paper, we present D-TensoRF, a tensorial radiance field for dynamic scenes, enabling novel view synthesis at a specific time. We consider the radiance field of a dynamic scene as a 5D tensor. The 5D tensor represents a 4D grid in which each axis corresponds to X, Y, Z, and time and has 1D multi-channel features per element. Similar to TensoRF, we decompose the grid either into rank-one vector components (CP decomposition) or low-rank matrix components (newly proposed MM decomposition). We also use smoothing regularization to reflect the relationship between features at different times (temporal dependency). We conduct extensive evaluations to analyze our models. We show that D-TensoRF with CP decomposition and MM decomposition both have short training times and significantly low memory footprints with quantitatively and qualitatively competitive rendering results in comparison to the state-of-the-art methods in 3D dynamic scene modeling.

研究の動機と目的

  • 変形ネットワークが遅いため、動的シーンに特化した従来の NeRF ベース手法の非効率性を解消すること。
  • 元々静的シーンを想定した TensoRF フレームワークを、5 次元テンソル表現を用いて動的シーンに拡張すること。
  • 動的シーン再構築におけるレンダリング品質を維持しつつ、学習時間とモデルサイズを削減すること。
  • 時間的依存性を明示的に取り入れるため、時間軸に沿った滑らかさ正則化を導入して運動の一貫性を向上させること。

提案手法

  • 空間(X, Y, Z)と時間(t)の次元を持つ 5 次元テンソルとして、動的シーンの放射場を表現し、各要素にマルチチャネル特徴を格納する。
  • CANDECOMP/PARAFAC(CP)分解を適用し、X, Y, Z, 時間軸に沿って 5 次元テンソルを低ランク成分に因子分解する。
  • CP よりも計算コストを低減する、新規の行列-行列(MM)分解を提案し、わずかにモデルサイズが増加する代わりに学習を高速化する。
  • 時間軸に沿ってガウスベースの滑らかさ正則化を導入し、隣接フレーム間の時間的整合性を強制する。
  • 低ランク成分を、小さなニューラルネットワークと微分可能なレンダリングプロセスを用いて最適化する。
  • 詳細と効率のバランスを取るために、適応的解像度を備えたグリッドベースの特徴表現を用いる。

実験結果

リサーチクエスチョン

  • RQ1別個の変形ネットワークに依存せずに、テンソルベースの放射場を動的シーンに拡張できるか?
  • RQ2動的シーンにおける学習速度、モデルサイズ、レンダリング品質という観点から、CP 分解と提案された MM 分解の性能を比較するとどうなるか?
  • RQ3時間的滑らかさ正則化は、動的シーンモデリングにおける運動の一貫性とレンダリング品質にどのような影響を与えるか?
  • RQ4グリッド解像度と成分数の変更が、詳細さ、シャープネス、計算コストのトレードオフにどのように影響するか?
  • RQ5明示的なテンソル分解と時間的正則化を用いて、コンパクトで高速かつ高品質な動的シーン再構築が達成可能か?

主な発見

  • CP 分解を用いた D-TensoRF は、モデルサイズがわずか 1.8 MB にまで小さく抑えられ、既存手法と比べ顕著に小さい。
  • MM 分解を用いた D-TensoRF は、学習時間をたった 16 分(60k ステップ)にまで短縮し、学習速度において SOTA を上回った。
  • 滑らかさ正則化により、CP 変種で PSNR が 1.77 dB(28.91 から 30.68 へ)向上し、LPIPS が 0.01(0.04 から 0.03 へ)低下した。これは正則化の必要性を裏付けた。
  • D-TensoRF は、最先端の LPIPS スコア(0.03)を達成し、新規ビュー合成における優れた知覚的品質を示した。
  • 150³×Nt 解像度で D-TensoRF-CP は静的領域をシャープにレンダリングしたが、100³×Nt 解像度の D-TensoRF-MM は、動的領域における詳細とぼかしの最適なバランスを達成した。
  • アブレーションスタディにより、高解像度および低解像度の両方のグリッド解像度が性能を低下させることを確認し、選択した解像度が最適であることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。