[論文レビュー] Harnessing Low-Frequency Neural Fields for Few-Shot View Synthesis
本稿では、少数のビューからの再構成において高周波数のニューラルレンダリング場(NeRF)の過学習を防ぐために、低周波数のニューラルフィールドを活用するHALOという手法を提案する。この手法は、レンダリング画像における周波数の一貫性を強制することで、過学習を抑制し、粗い幾何形状の予測(低周波数)と細部のモデリング(高周波数)を分離することで、静的および動的シーンの両方において一般化性能を向上させ、アーチファクトを低減する。効率的な学習を実現し、最先端の性能を達成している。
Neural Radiance Fields (NeRF) have led to breakthroughs in the novel view synthesis problem. Positional Encoding (P.E.) is a critical factor that brings the impressive performance of NeRF, where low-dimensional coordinates are mapped to high-dimensional space to better recover scene details. However, blindly increasing the frequency of P.E. leads to overfitting when the reconstruction problem is highly underconstrained, \eg, few-shot images for training. We harness low-frequency neural fields to regularize high-frequency neural fields from overfitting to better address the problem of few-shot view synthesis. We propose reconstructing with a low-frequency only field and then finishing details with a high-frequency equipped field. Unlike most existing solutions that regularize the output space (\ie, rendered images), our regularization is conducted in the input space (\ie, signal frequency). We further propose a simple-yet-effective strategy for tuning the frequency to avoid overfitting few-shot inputs: enforcing consistency among the frequency domain of rendered 2D images. Thanks to the input space regularizing scheme, our method readily applies to inputs beyond spatial locations, such as the time dimension in dynamic scenes. Comparisons with state-of-the-art on both synthetic and natural datasets validate the effectiveness of our proposed solution for few-shot view synthesis. Code is available at \href{https://github.com/lsongx/halo}{https://github.com/lsongx/halo}.
研究の動機と目的
- 高周波数の位置符号化が一般化性能を悪化させる少数ビュー設定下でのNeRFにおける過学習を解消すること。
- 低周波数と高周波数のニューラルフィールドが持つ補完的な補間および外挿特性を活用し、より優れた新規ビュー再構成を実現すること。
- 事前学習済みの事前分布や真値周波数の調整に依存しない、データフリーで入力空間における正則化戦略の開発。
- 時間次元を追加入力次元として扱うことで動的シーンへの拡張を図り、効率性を維持するとともに時間的フレイキングを低減すること。
- レンダリング画像の周波数ドメインの一貫性に基づく、簡単で効果的な周波数チューニング基準の提案。
提案手法
- 2ストリームアーキテクチャを採用:低周波数のみのレイベースのフィールドで粗い幾何形状と深度を予測し、高周波数のポイントベースのフィールドで細部をモデリングする。
- 低周波数のレイベースのフィールドは、各レイごとの深度値を予測することを目的とし、滑らかで低周波数の信号に対して効率的かつ安定した最適化を可能にする。
- 高周波数の詳細は、別個のポイントベースの放射場によって追加され、低周波数の幾何形状予測によって正則化されることで、過学習を防ぐ。
- 周囲の視点変更に対してレンダリング画像の周波数ドメインが安定するまで、逐次的に位置符号化周波数を低減する周波数チューニング戦略を導入。
- 周波数一貫性基準は2次元画像の周波数ドメインで適用され、スペクトル変化のしきい値を用いて最適な符号化周波数を特定する。
- 時間次元を入力次元として追加することで、動的シーンへの拡張が可能であり、時間周波数ドメインに対しても同様の正則化が適用される。
実験結果
リサーチクエスチョン
- RQ1低周波数のニューラルフィールドは、少数ビュー再構成における高周波数NeRFの過学習を効果的に抑制できるか?
- RQ2入力空間における低周波数信号による正則化は、出力空間の正則化に比べ、一般化性能およびアーチファクト低減の観点で優れているか?
- RQ3レンダリング画像のスペクトル的一貫性に基づく周波数チューニング基準は、人為的または真値ガイドドの周波数選択を置き換えることができるか?
- RQ4本手法は、スパarsなマルチビューおよび時間的観測が得られる動的シーンにおいて、どのように性能を発揮するか?
- RQ5時間次元の周波数を制御することで、動的NeRFにおける時間的フレイキングを低減できるか?
主な発見
- StanfordLFデータセットにおいて、HALOは4コーナービュー設定下でPSNR 25.687を達成し、DietNeRF(22.815)およびRegNeRF(23.995)を大きく上回った。
- LLFFデータセットでは、HALOはPSNR 25.687、SSIM 0.914を達成し、4つの訓練ビューでのみの学習でも強力な一般化性能を示した。
- 動的シーンでは、時間的フレイキングが低減され、視覚的品質が向上し、TiNeuVox-S(0.182)と比較してLPIPSが11.6%低減(0.116)された。
- 訓練時間は1シーンあたり0.67 GPU時間にまで短縮され、DietNeRF(4.25)およびRegNeRF(3.33)を著しく上回る。
- 真値や事前学習済みの事前分布を必要とせず、周波数チューニング戦略が最適な符号化周波数を的確に同定でき、低データ環境下でのロバストネスが向上した。
- 視覚的比較では、HALOはTiNeuVoxや他のベースラインと比較して、特に未観測領域や動的シーケンスにおいて、より鋭い細部とより少ない浮遊アーチファクトを生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。