[論文レビュー] Neural Rerendering in the Wild
本論文は、インターネット写真のみを用いて、観光名所のリアルな、外観制御可能なレンダリングを可能にするニューラルリレンダリングフレームワークを提案する。3次元ポイントクラウドプロキシの再構築と、外観および意味的条件付きの延期シェーディングバッファに条件付きGANを訓練することで、多様な照明および一時的状況下でも高精細なビューおよび外観補間を実現し、トレヴィとパラステオの複数のデータセットで先行手法を上回る性能を発揮する。
We explore total scene capture -- recording, modeling, and rerendering a scene under varying appearance such as season and time of day. Starting from internet photos of a tourist landmark, we apply traditional 3D reconstruction to register the photos and approximate the scene as a point cloud. For each photo, we render the scene points into a deep framebuffer, and train a neural network to learn the mapping of these initial renderings to the actual photos. This rerendering network also takes as input a latent appearance vector and a semantic mask indicating the location of transient objects like pedestrians. The model is evaluated on several datasets of publicly available images spanning a broad range of illumination conditions. We create short videos demonstrating realistic manipulation of the image viewpoint, appearance, and semantic labeling. We also compare results with prior work on scene reconstruction from internet photos.
研究の動機と目的
- 公開済みのインターネット写真のみを用いて、あらゆる外観下でのシーンの記録とリレンダリングを可能にする、完全なシーンキャプチャを実現すること。
- 従来の3次元再構築手法の限界、すなわち外観の多様性に欠ける非現実的なレンダリングを是正すること。
- 明示的な3次元プロキシを用いて入力画像を視点、外観、意味的コンテンツに分解し、制御性と現実性を向上させること。
- プロキシスタイル損失を用いた事前学習により、潜在空間の質を向上させ、モデルの汎化性能を高める段階的トレーニング戦略の開発。
提案手法
- 本手法は、インターネット写真からの3次元再構築を出発点とし、密でノイズの多いポイントクラウドを3次元プロキシとして生成する。
- 各入力画像に対して、ポイントクラウドから深さ、色、意味ラベルを格納する深さフレームバッファ(延期シェーディングバッファ)をレンダリングする。
- 深さフレームバッファ、潜在的外観ベクトル、意味マスクを入力として受け取り、リアルな画像を生成する条件付きGANベースのリレンダリングネットワークを採用する。
- リレンダリングネットワークの条件付けに使用する外観エンコーダーは、事前学習段階でプロキシスタイル損失(例:知覚損失)を用いて学習し、その後固定される。
- 段階的トレーニングは、まず外観エンコーダーの事前学習を行い、次に固定された埋め込みを用いてリレンダリングネットワークを学習し、最後に両ネットワークを共同で微調整する。
- 意味マスクを用いることで、歩行者などの一時的オブジェクトを無視または除去できるようにし、耐性向上と人物なしレンダリングの実現を可能にする。
実験結果
リサーチクエスチョン
- RQ1神経的リレンダリングシステムは、制御不能なインターネット写真のみを用いて、多様な外観下のシーンの写真レベルの再現可能な画像を生成できるか?
- RQ2プロキシ外観損失を用いた段階的トレーニングは、エンドツーエンドトレーニングと比較して、分離可能で意味のある外観潜在空間を学習する上でどの程度効果的か?
- RQ3意味的条件付けは、弱く再構築されたシーンにおける一時的オブジェクトおよび幾何的アーチファクトの処理能力をどの程度向上できるか?
- RQ4異なる照明、天候、時間帯の条件下でも、モデルはビューおよび外観補間においてどの程度の性能を発揮するか?
- RQ5特別な取得装置を一切使用しない状況でも、3次元ポイントクラウドプロキシのみを用いて、先行研究を上回る結果を達成できるか?
主な発見
- 本モデルは、ビューおよび外観補間において優れた性能を発揮し、トレヴィ、パラステオ、ドゥブロヴニクのデータセットで、推定されたセグメンテーションマスクを使用しても、BicycleGANベースラインを上回っている。
- 外観事前学習を伴う段階的トレーニングにより、t-SNE可視化で示されるように、より意味的で構造的な潜在空間が得られ、微調整後にクラスタが形成された。
- 実世界の状況で推定されたセグメンテーションマスクを使用しても、本モデルは高い性能を維持しており、トレヴィではPSNRが17.90、パラステオでは17.29を記録した。
- 神経的リレンダリングネットワークは、初期レンダリングに内部構造が見えやすいにもかかわらず、図11で示されるように、隠蔽領域を的確に推定し、アーチファクトを回避している。
- 意味的条件付けにより、視点、外観、意味的コンテンツの動的制御が可能となり、人物なしレンダリングを含むビデオスタイルの操作が実現された。
- 事前学習により学習された潜在的外観空間は、初期段階と比較して質が向上し、クラスタリングも明確になった。BicycleGANベースラインに近い品質にまで到達している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。