[論文レビュー] im2nerf: Image to Neural Radiance Field in the Wild
im2nerf は、分離された形状、外観、カメラポーズコードを用いて、野生の状態の1枚の未アライメント画像から連続的なニューラルレンダリングフィールド(NeRF)を自己教師的に予測するフレームワークを提案する。敵対的損失、対称性、シーンボックス制約、サイクルポーズ一貫性を活用することで、マルチビューの教師信号や3次元アノテーションが不要な状態でも、最先端の新規ビュー合成性能を達成する。
We propose im2nerf, a learning framework that predicts a continuous neural object representation given a single input image in the wild, supervised by only segmentation output from off-the-shelf recognition methods. The standard approach to constructing neural radiance fields takes advantage of multi-view consistency and requires many calibrated views of a scene, a requirement that cannot be satisfied when learning on large-scale image data in the wild. We take a step towards addressing this shortcoming by introducing a model that encodes the input image into a disentangled object representation that contains a code for object shape, a code for object appearance, and an estimated camera pose from which the object image is captured. Our model conditions a NeRF on the predicted object representation and uses volume rendering to generate images from novel views. We train the model end-to-end on a large collection of input images. As the model is only provided with single-view images, the problem is highly under-constrained. Therefore, in addition to using a reconstruction loss on the synthesized input view, we use an auxiliary adversarial loss on the novel rendered views. Furthermore, we leverage object symmetry and cycle camera pose consistency. We conduct extensive quantitative and qualitative experiments on the ShapeNet dataset as well as qualitative experiments on Open Images dataset. We show that in all cases, im2nerf achieves the state-of-the-art performance for novel view synthesis from a single-view unposed image in the wild.
研究の動機と目的
- マルチビューの一貫性や3次元教師信号が利用できない野生の状態の1枚の未アライメント画像から3次元ニューラルレンダリングフィールドを学習する課題に対処すること。
- セグメンテーションと画像レベルの教師信号のみを用いて、1枚の画像から形状、外観、カメラポーズを分離した3次元表現を学習すること。
- 世界の知識(例:対称性、シーン構造、ポーズ一貫性)からの補助的メタ教師信号を導入することで、極めて制約の厳しい条件下でも一般化性と現実性を向上させること。
- 豊富なラベルなしデータを活用して、ポーズアノテーションの1%のみを用いる弱教師付き学習を可能にし、完全教師付き学習と同等の性能を達成すること。
提案手法
- モデルはオートエンコーダベースのアーキテクチャを採用:エンコーダーが入力画像を形状コード、外観コード、予測カメラポーズに分離する。
- NeRFに類似したデコーダーがボリュームレンダリングを用い、予測された形状コードと外観コード、カメラポーズを条件として新規ビューを合成する。
- 訓練では、入力ビューにおける再構成損失、新規ビューのレンダリングにおける敵対的損失、幾何的一致性を向上させるための対称性正則化が用いられる。
- 再エンコーディングによってレンダリングされた新規ビューを元のカメラポーズに予測することで、サイクル一貫性損失が適用され、幾何学的妥当性が強化される。
- シーンボックス制約が、3次元形状とカメラポーズの予測が現実的な空間的範囲内に留まるように正則化に用いられる。
- 本フレームワークは、3次元教師信号やマルチビュー入力が一切ない状態で、ShapeNet や Open Images といった大規模データセット上でエンドツーエンドに訓練される。
実験結果
リサーチクエスチョン
- RQ1マルチビュー教師信号が存在しない状態で、野生の1枚の未アライメント画像から連続的な3次元ニューラルレンダリングフィールドを予測することは可能か?
- RQ2世界の知識(例:対称性、シーン構造、ポーズ一貫性)からのメタ教師信号は、単一画像からの3次元再構築をどのように向上させるか?
- RQ3敵対的学習とサイクル一貫性損失は、新規ビュー合成の現実性と幾何的正確性をどの程度向上させるか?
- RQ4ポーズアノテーションの最小限の教師信号でのみ学習する場合、モデルは Open Images のような実世界データセットに一般化できるか?
主な発見
- im2nerf は、ShapeNet 3D-R2N2 データセットにおいて、航空機カテゴリでPSNRが22.2に達し、先行手法を著しく上回る最先端の新規ビュー合成性能を達成した。
- Open Images データセットでは、定性的な結果から、im2nerf は Ye ら [48] や PrGAN といったベースラインと比較して、より現実的かつ一貫性のある新規ビューを生成した。
- アブレーションスタディの結果、敵対的損失、シーンボックス、サイクルポーズ一貫性が性能向上に不可欠であることが確認され、それぞれが現実性と幾何的一致性の向上に寄与した。
- 弱教師付き設定において、ポーズアノテーションの1%のみを用いた場合でも、im2nerf は完全教師付き学習と同等の性能を達成し、優れたデータ効率性を示した。
- 形状Net および Open Images における定性的な結果から、車両や航空機など多様なオブジェクトカテゴリに、モデルが良好に一般化していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。