[論文レビュー] Continuous Object Representation Networks: Novel View Synthesis without Target View Supervision
本稿では、自己教師ありニューラルネットワークであるContinuous Object Representation Networks (CORN) を提案する。CORNは、2枚の入力画像からのみ、連続的で微分可能な3次元シーン表現を学習することで、新しい視点の合成を実現する。変換チェーンと3次元特徴の一貫性を自己教師信号として活用することで、3次元の真値データやターゲット視点の教師信号を一切必要とせず、先行手法と比較して学習画像を50倍も削減した状態で、新視点合成および1枚画像からの3次元再構築において最先端の性能を達成する。
Novel View Synthesis (NVS) is concerned with synthesizing views under camera viewpoint transformations from one or multiple input images. NVS requires explicit reasoning about 3D object structure and unseen parts of the scene to synthesize convincing results. As a result, current approaches typically rely on supervised training with either ground truth 3D models or multiple target images. We propose Continuous Object Representation Networks (CORN), a conditional architecture that encodes an input image's geometry and appearance that map to a 3D consistent scene representation. We can train CORN with only two source images per object by combining our model with a neural renderer. A key feature of CORN is that it requires no ground truth 3D models or target view supervision. Regardless, CORN performs well on challenging tasks such as novel view synthesis and single-view 3D reconstruction and achieves performance comparable to state-of-the-art approaches that use direct supervision. For up-to-date information, data, and code, please see our project page: https://nicolaihaeni.github.io/corn/.
研究の動機と目的
- 3次元の真値データやマルチビューの教師信号を一切必要とせず、オブジェクトのインスタンスに一般化可能な新視点合成手法の開発。
- 1オブジェクトあたり2枚の画像での学習により、3次元シーン表現学習におけるデータ依存性の低減。
- エンドツーエンドで学習可能な連続的3次元シーン表現の実現を図り、高解像度かつマルチビュー一貫性のあるレンダリングを可能にすること。
- 限定的な教師信号から、自己教師あり3次元再構築およびドメイン外一般化の可能性を実証すること。
提案手法
- CORNは、2枚の入力画像から局所的およびグローバルな特徴をエンコードし、空間的特徴マップに統合することで、連続的で微分可能な3次元表現を学習する。
- モデルは、1つのソースビューから別のビューへの特徴のマッピングを実現する変換チェーンを用い、3次元特徴の一貫性を自己教師信号として強制する。
- 微分可能なニューラルレンダラにより、暗黙的な3次元表現から新視点をレンダリング可能となり、エンドツーエンドの学習が可能になる。
- マルチビュー一貫性は、サイクル一貫性によって強制される:特徴をビューAからBに変換し、再びAへ戻すことで、再構成誤差を最小化する。
- アーキテクチャは条件付きであり、テスト時における高速な推論を可能にし、潜在変数の最適化を必要としない。
- ボクセルやポイントクラウドなどの離散表現を回避することで、任意の空間解像度を実現し、メモリ使用量を削減する。
実験結果
リサーチクエスチョン
- RQ13次元の教師信号が一切ない状態で、2枚の画像からのみ3次元一貫性のあるシーン表現を学習できるか?
- RQ2特徴の一貫性と変換チェーンを用いた自己教師学習が、教師あり手法と同等の性能を達成できるか?
- RQ3トレーニング時に見られなかったドメイン外のポーズや実世界の画像に対しても、モデルは新しい視点に一般化できるか?
- RQ41枚の入力画像と学習済み表現のみで、高品質な1枚画像からの3次元再構築が可能か?
主な発見
- CORNは、1オブジェクトあたり2枚の学習画像でのみ、新視点合成において最先端の性能を達成し、数十枚の画像と直接的なターゲット視点の教師信号を必要とする手法を上回る。
- モデルは、合成データであるShapeNetで学習した後でも、Carsデータセットの実世界画像に対して良好に一般化し、ドメイン転送能力を示している。
- 1枚の入力画像からの1枚画像3次元再構築は、全体の形状と微細なディテールの両方を正確に捉えた高品質な3次元再構築を実現している。
- CORNは、ソース画像が類似した視点であっても、重複のない視点であっても、視点間で強力な幾何学的および光度的一貫性を維持している。
- 最先端の教師ありアプローチと比較して、学習データ要件を50倍も削減しながら、同等またはそれ以上の性能を達成している。
- 変換チェーンと3次元特徴の一貫性を用いた自己教師学習スキームは、自明な解を回避し、安定的で意味のある3次元表現学習を可能にしている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。