Skip to main content
QUICK REVIEW

[論文レビュー] Generative View Synthesis: From Single-view Semantics to Novel-view Images

Tewodros Habtegebrial, Varun Jampani|arXiv (Cornell University)|Aug 20, 2020
Computer Graphics and Visualization Techniques被引用数 7
ひとこと要約

本稿では、単一の2次元セマンティックマップから、3次元シーン構造と外観を同時に推定することで、写真同等の質で幾何学的に整合性のある新規視点画像を生成する、生成的ビュー合成(GVS)を提案する。セマンティックマップを3次元レイヤー形式に昇華させ、レイヤー化された特徴をターゲット視点に投影し、スタイル編集やセマンティック操作をサポートする高精細で視点整合性のある画像を生成する。

ABSTRACT

Content creation, central to applications such as virtual reality, can be a tedious and time-consuming. Recent image synthesis methods simplify this task by offering tools to generate new views from as little as a single input image, or by converting a semantic map into a photorealistic image. We propose to push the envelope further, and introduce Generative View Synthesis (GVS), which can synthesize multiple photorealistic views of a scene given a single semantic map. We show that the sequential application of existing techniques, e.g., semantics-to-image translation followed by monocular view synthesis, fail at capturing the scene's structure. In contrast, we solve the semantics-to-image translation in concert with the estimation of the 3D layout of the scene, thus producing geometrically consistent novel views that preserve semantic structures. We first lift the input 2D semantic map onto a 3D layered representation of the scene in feature space, thereby preserving the semantic labels of 3D geometric structures. We then project the layered features onto the target views to generate the final novel-view images. We verify the strengths of our method and compare it with several advanced baselines on three different datasets. Our approach also allows for style manipulation and image editing operations, such as the addition or removal of objects, with simple manipulations of the input style images and semantic maps respectively. Visit the project page at https://gvsnet.github.io.

研究の動機と目的

  • 単一のセマンティックマップから幾何学的および光度的に整合性のある新規ビューを生成する課題に取り組み、従来の順次パイプラインが十分に解決できない問題を解決すること。
  • セマンティックから画像への変換を実行した後に単眼ビュー合成を適用する手法の限界を克服し、視点間で構造的不整合が生じるのを防ぐこと。
  • セマンティックマップに明示的な隠蔽境界が存在することを活用し、3次元シーン構造推定とビュー整合性の向上を図ること。
  • ユーザーがセマンティック(例:オブジェクトの挿入/削除)を編集できる直感的なコンテンツ作成を可能にし、変更をすべての新規ビューに一貫して反映させること。
  • 単一視点のセマンティクスから高品質な深度マップを予測できることを示し、これにより下流の3次元対応アプリケーションに有用である。

提案手法

  • メモリコストを低減するために、セマンティックレイヤーと透過性レイヤーのハイブリッド構造を用いて、入力の2次元セマンティックマップを3次元レイヤー形式に変換(「昇華されたセマンティクス」と呼称)。
  • ニューラルネットワークを用いて、昇華されたセマンティクスをレイヤー化された外観特徴に変換し、特徴空間におけるセマンティックおよび幾何的構造を保持する。
  • 微分可能なワープおよびブレンド操作を用いて、レイヤー化された外観特徴をターゲット視点平面に投影し、新規ビュー特徴を生成する。
  • 軽量なリファインメントネットワークを用いて、投影された特徴を最終的なRGB画像に変換し、写真同等の質と整合性を確保する。
  • MPI平面全体にわたる透過性推定(アルファ)を統合し、単一のセマンティクス入力からの深度マップ予測を可能にし、3次元構造理解を強化する。
  • スタイル画像を条件として外観変換を制御することでスタイル編集を可能にし、入力セマンティックマップの直接的変更によりセマンティック編集をサポートする。

実験結果

リサーチクエスチョン

  • RQ1入力RGB画像を必要とせず、単一のセマンティックマップから複数の写真同等の質で幾何学的に整合性のある新規ビューを生成できるか?
  • RQ2セマンティクスから3次元レイアウトと外観を同時に推定することで、セマンティクスから画像への変換と単眼ビュー合成を順次適用する手法に比べて性能が向上するか?
  • RQ3セマンティックマップが明示的な隠蔽境界を有するため、ビュー合成においてRGB画像よりも強い構造的事前知識を提供できるか?
  • RQ41つのセマンティックマップを用いて、オブジェクトの挿入/削除などのセマンティック編集を、複数の新規ビューに一貫して反映できるか、その範囲はどの程度か?
  • RQ5単一のセマンティクス入力から高品質な深度マップを直接推定できるか?また、RGBベースの深度推定手法と比較してどのように異なるか?

主な発見

  • GVSNetは、SPADE + 単眼MPIといったベースライン手法に比べ、細い構造や隠蔽境界の維持において顕著に幾何学的に整合性の高い新規ビューを生成する。
  • SUN+SPADEと比較して、各視点ごとに独立して画像変換を行うため構造的不整合が生じるが、本手法は優れたビュー整合性を達成する。
  • RGBで学習されたMonoDepthと比較して、単一のセマンティクスからの深度推定は、細い構造や微細構造領域でより正確な深度マップを生成する。
  • 本手法は効果的なセマンティック編集を可能にする:2次元セマンティックマップでのオブジェクト挿入・削除が、すべての視点に一貫して現実的で整合性のある新規ビューに反映される。
  • 本手法はCARLA、Cityscapes、Virtual-KITTI-2の複数のデータセットにわたって汎用性を示し、3次元に意識されたセマンティクスの昇華と特徴投影パイプラインの強靭性と転送可能性を裏付けている。
  • セマンティックレイヤーと透過性レイヤーのハイブリッドレイヤー表現は、高品質な合成と深度推定を維持しつつ、メモリ使用量を効果的に削減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。