[論文レビュー] Generalizable Neural Radiance Fields for Novel View Synthesis with Transformer
本論文は、任意の数のソースビューとターゲットの新規ビューの間の複雑で非線形的な関係をモデル化することで、一般化可能なシーン表現を学習する、Transformerに基づくニューラルレンダリングフィールドフレームワーク、TransNeRFを提案する。統合されたアーキテクチャで自己注意およびクロス注意メカニズムを活用することで、MLPベースのNeRFと比較して、局所的な幾何学的・外観的一致性をより効果的に捉えることができ、特に大きな視点差がある状況下でも、シーンに依存しないおよび各シーンごとの微調整設定の両方で最先端の性能を達成する。
We propose a Transformer-based NeRF (TransNeRF) to learn a generic neural radiance field conditioned on observed-view images for the novel view synthesis task. By contrast, existing MLP-based NeRFs are not able to directly receive observed views with an arbitrary number and require an auxiliary pooling-based operation to fuse source-view information, resulting in the missing of complicated relationships between source views and the target rendering view. Furthermore, current approaches process each 3D point individually and ignore the local consistency of a radiance field scene representation. These limitations potentially can reduce their performance in challenging real-world applications where large differences between source views and a novel rendering view may exist. To address these challenges, our TransNeRF utilizes the attention mechanism to naturally decode deep associations of an arbitrary number of source views into a coordinate-based scene representation. Local consistency of shape and appearance are considered in the ray-cast space and the surrounding-view space within a unified Transformer network. Experiments demonstrate that our TransNeRF, trained on a wide variety of scenes, can achieve better performance in comparison to state-of-the-art image-based neural rendering methods in both scene-agnostic and per-scene finetuning scenarios especially when there is a considerable gap between source views and a rendering view.
研究の動機と目的
- MLPベースのNeRFの、任意の数のソースビューを処理する能力およびソースビューとターゲットビューの間の複雑で非線形的な関係を捉える能力の制限を解決すること。
- 局所的な幾何学的・外観的一致性を維持する統一的かつビュー一貫性のあるシーン表現を学習することで、新規ビュー合成における一般化性能を向上させること。
- 従来の画像条件付きNeRFで用いられるプーリングベースの統合に依存する問題を克服し、ソースビューとレンダリングビューの間の深い高レベルの依存関係をモデル化できること。
- ソースビューとターゲットビューの差が著しく、特に視点ギャップが大きい実世界のシナリオにおいても、堅牢な性能を発揮できること。
- 合成データセットおよび実世界データセットの両方で、シーンに依存しないおよび各シーンごとの微調整設定の両方において、優れた性能を示すこと。
提案手法
- 複数のソースビューからの2次元投影ピクセルと、照準線に沿った3次元ポイントを、統合されたアテンション空間で同時に処理する統一されたTransformerエンコーダ・デコーダアーキテクチャを導入する。
- ソースビュー間の長距離依存関係をモデル化するためにマルチヘッド自己注意を用い、照準線に沿った3次元照準ポイントとソースビュー特徴を一致させるためにクロス注意を用いる。
- 3次元空間座標および2次元カメラポーズの両方の位置エンコーディングを組み込み、幾何学的およびビュー固有の文脈を保持する。
- 複数のソースビューからのアテンション集約特徴に条件付けられた、座標に基づくシーン表現を採用する。
- 各3次元ポイントに対して学習可能な照準埋め込みを用いて、関連する特徴を複数のソースビューから動的に統合可能にする。
- 大規模かつ多様なマルチシーンデータセット上でエンドツーエンドに学習することで、一般化可能な新規ビュー合成のための汎用的事前知識を学習する。
実験結果
リサーチクエスチョン
- RQ1変換器ベースのアーキテクチャは、ニューラルレンダリングフィールドにおいて、任意の数のソースビューとターゲット新規ビューの間の複雑で非線形的な関係を効果的にモデル化できるか?
- RQ2アテンションに基づく特徴統合は、プーリングベースの統合に比べて、ビュー一貫性のあるシーン表現のための高レベルの依存関係を捉える上で優れているか?
- RQ31つのシーンに依存しないTransNeRFモデルは、各シーンごとの微調整なしで、特に大きな視点差がある状況下でも、効果的に一般化できるか?
- RQ4シーンに依存しないおよび各シーンごとの微調整設定の両方において、TransNeRFの性能は最先端の画像ベースレンダリング手法と比較してどうか?
- RQ5アテンション機構は、照準線および周囲のビュー全体にわたる形状と外観の局所的一致性をどの程度向上させるか?
主な発見
- TransNeRFは、合成データセットおよび実世界データセットの両方で、シーンに依存しないおよび各シーンごとの微調整設定の両方において、最先端の性能を達成する。
- 実世界のフォワードフェーシングデータセットでは、シーンに依存しない設定でPSNRが29.41、SSIMが0.942を達成し、IBRNet(PSNR: 28.73、SSIM: 0.930)およびPixelNeRF(PSNR: 28.55、SSIM: 0.927)を上回る。
- 各シーンごとの微調整設定では、実データセットでPSNRが30.12、SSIMが0.951を達成し、IBRNet(PSNR: 29.31、SSIM: 0.940)およびMVSNeRF(PSNR: 29.05、SSIM: 0.935)を顕著に上回る。
- 視点ギャップが大きい状況(例:S3)では、ベースライン手法と比較してLPIPSが15〜20%低減され、知覚的アーティファクトが少ないことが示された。
- 定性的な結果から、TransNeRFは、特にソースビューとターゲットビューの距離が離れている場合でも、細い枝や葉の縁といった微細構造をベースラインと比較してより正確に保持している。
- ソースビューとターゲットビューの差が大きくなるほど、TransNeRFとベースラインの性能差が拡大するため、困難なビュー設定に対しても堅牢であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。