Skip to main content
QUICK REVIEW

[論文レビュー] Coordinates Are NOT Lonely -- Codebook Prior Helps Implicit Neural 3D Representations

Fukun Yin, Wen Liu|arXiv (Cornell University)|Oct 20, 2022
3D Shape Modeling and Analysis被引用数 6
ひとこと要約

本論文は、2つのアテンションモジュール(コードブックアテンションおよび座標アテンション)を介して学習済みコードブックからの事前知識を統合することで、座標ベースのマルチレイヤーパーセプトロン(MLP)を強化する、新しい暗黙的ニューラル3D表現フレームワーク、CoCo-INRを提案する。事前学習済みのプロトタイプを大規模データセットから得ることで、わずか3〜8枚の入力ビューでのみ、Novel View Synthesisおよび3D再構築において最先端の性能を達成し、疎な監視下でも写真のようにリアルで幾何学的に正確な再構築を顕著に向上させる。

ABSTRACT

Implicit neural 3D representation has achieved impressive results in surface or scene reconstruction and novel view synthesis, which typically uses the coordinate-based multi-layer perceptrons (MLPs) to learn a continuous scene representation. However, existing approaches, such as Neural Radiance Field (NeRF) and its variants, usually require dense input views (i.e. 50-150) to obtain decent results. To relive the over-dependence on massive calibrated images and enrich the coordinate-based feature representation, we explore injecting the prior information into the coordinate-based network and introduce a novel coordinate-based model, CoCo-INR, for implicit neural 3D representation. The cores of our method are two attention modules: codebook attention and coordinate attention. The former extracts the useful prototypes containing rich geometry and appearance information from the prior codebook, and the latter propagates such prior information into each coordinate and enriches its feature representation for a scene or object surface. With the help of the prior information, our method can render 3D views with more photo-realistic appearance and geometries than the current methods using fewer calibrated images available. Experiments on various scene reconstruction datasets, including DTU and BlendedMVS, and the full 3D head reconstruction dataset, H3DS, demonstrate the robustness under fewer input views and fine detail-preserving capability of our proposed method.

研究の動機と目的

  • 高品質な再構築に密な入力ビューを必要とする暗黙的ニューラル3D表現の限界を解消すること。
  • コードブックからの事前知識が、暗黙的ニューラルネットワークにおける座標特徴表現をどのように豊かにできるかを調査すること。
  • 構造的な事前情報の導入により、校正済みの多数の画像に依存する必要を減らすこと。
  • 疎な入力設定下でも、Novel View Synthesisのロバスト性とリアリズムを向上させること。
  • より良い一般化を実現するため、座標と学習済みでシーンに依存しないプロトタイプを結びつける新しいパラダイムを確立すること。

提案手法

  • 学習可能な埋め込みを用いて、事前学習済みで固定されたコードブックからシーン関連のプロトタイプを照合するコードブックアテンションモジュールを導入する。
  • 選択されたプロトタイプを各空間座標に統合することで、特徴表現を豊かにする座標アテンションモジュールを採用する。
  • 固定で事前学習済みのVQ-VAEコードブック(例:VQGANを介したImageNetから)を用い、一貫性があり高レベルの意味的事前知識を提供する。
  • 両アテンションモジュールを共有MLPアーキテクチャに適用し、コードブックのシーン別微調整なしに特徴学習を強化する。
  • 微分可能アテンション機構を用いて、事前知識と座標特徴の動的統合を可能にするエンドツーエンドの学習を実施する。
  • 極めて疎なビュー(例:3ビュー)を用いた学習時にマスキングを適用し、前面の幾何学的形状と外観に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1わずか数枚の入力ビューでのみ、事前学習済みコードブックからの事前知識が3D再構築およびNovel View Synthesisの品質を向上させられるか?
  • RQ2コードブックプロトタイプを座標特徴に統合することで、疎な監視下でもネットワークのNovel Viewへの一般化能力にどのような影響を与えるか?
  • RQ3固定で事前学習済みのコードブックとシーン別に学習可能なコードブックの両方を用いた場合、低ショット3D再構築における性能にどのような差が生じるか?
  • RQ4コードブックアイテムの数と品質が、暗黙的ニューラル表現の性能に与える影響は何か?
  • RQ5プロトタイプと座標のアテンションベース統合は、標準的なMLPベース手法に比べ、より写真のようにリアルで幾何学的に正確なレンダリングを可能にするか?

主な発見

  • DTUデータセットで3枚のトレーニングビューでのみ、CoCo-INRは平均PSNR 19.084を達成し、VolSDF(18.939)を上回り、LPIPSが25%低減(0.165 vs. 0.317)しており、意味的レベルのリアリズムが優れていることを示している。
  • 5〜8枚のビューを用いた場合、固定で事前学習済みのコードブックを使用する手法は、シーン別に学習可能なコードブック(13.315)を著しく上回り、汎用的で一般化可能な事前知識の価値を証明している。
  • 16,384個のコードブックアイテムを用いることで最良の性能(PSNR: 15.622)が得られ、アイテム数が減ると性能が低下するため、コードブックサイズに感受性があることが示された。
  • アブレーションスタディにより、コードブックアテンションが均一なテクスチャを持つシーンのロバスト性を向上させ、意味のあるプロトタイプを抽出できることを確認した。
  • 可視化結果から、CoCo-INRは微細な幾何的ディテールを保持し、極端に疎なビュー(3ビュー)下でも一貫性があり写真のようにリアルなNovel Viewを生成していることがわかった。
  • 本手法は、DTU、BlendedMVS、H3DSといった多様なベンチマークに一般化でき、コードブック事前知識の強力なゼロショット転送性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。