Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Texture Optimization from RGB-D Scans

Jingwei Huang, Justus Thies|arXiv (Cornell University)|Mar 18, 2020
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 9
ひとこと要約

本論文は、幾何学的ズレやカメラポーズのズレに対して頑健であるように訓練されたパッチベースの条件付き識別器を用いる、新しい敵対的テクスチャ最適化フレームワークを提案する。実際のズレを伴う画像ペアを「本物」とするトレーニング例として用いることで、明示的な誤差パラメトリックモデルを必要とせずに、よりシャープで現実的であるテクスチャを、最先端の手法よりも生成する。

ABSTRACT

Realistic color texture generation is an important step in RGB-D surface reconstruction, but remains challenging in practice due to inaccuracies in reconstructed geometry, misaligned camera poses, and view-dependent imaging artifacts. In this work, we present a novel approach for color texture generation using a conditional adversarial loss obtained from weakly-supervised views. Specifically, we propose an approach to produce photorealistic textures for approximate surfaces, even from misaligned images, by learning an objective function that is robust to these errors. The key idea of our approach is to learn a patch-based conditional discriminator which guides the texture optimization to be tolerant to misalignments. Our discriminator takes a synthesized view and a real image, and evaluates whether the synthesized one is realistic, under a broadened definition of realism. We train the discriminator by providing as `real' examples pairs of input views and their misaligned versions -- so that the learned adversarial loss will tolerate errors from the scans. Experiments on synthetic and real data under quantitative or qualitative evaluation demonstrate the advantage of our approach in comparison to state of the art. Our code is publicly available with video demonstration.

研究の動機と目的

  • 共通する誤差(カメラポーズのズレやノイズの多い幾何構造など)が生じるにもかかわらず、RGB-Dスキャンから写真同等のリアルなテクスチャを生成する課題に対処すること。
  • カメラアライメント、画像マッピング、カラーバランスのための手作業で設計されたパrametricモデルに依存する従来の最適化手法の限界を克服すること。
  • スキャンアーチファクトやズレに対して本質的に頑健な、学習された敵対的目的関数を開発すること。
  • 大きな幾何的およびポーズの差異が生じる状況でも、実世界の画像を用いて実スキャンおよびCADモデルの高品質なテクスチャ化を可能にすること。

提案手法

  • 条件付き識別器を訓練し、ズレを伴うスキャンからの再投影画像(本物)と、最適化されたテクスチャからレンダリングされた合成画像を区別させること。
  • 識別器は、実際のペアとズレを伴う視点ペアを用いて訓練されるため、一般的なスキャン誤差に耐えながらも、ぼやけやシームアーチファクトのような合成アーチファクトを検出できる。
  • テクスチャ最適化は識別器と同時に敵対的損失を用いて行い、生成されたテクスチャが本物の再投影ビューと区別がつかないよう促進する。
  • 明示的なビュー選択やブレンド戦略を避けるために、学習されたメトリクスを通じて複数のビューからの色の統合を暗黙的に行う。
  • 局所的なリアルさに注目し、細粒度のテクスチャ品質を向上させるために、パッチベースの識別器を用いる。
  • 本手法は、実スキャンおよびスキャンにアライメントされたCADモデルの両方に対して適用可能であり、顕著な幾何的不一致が生じる状況でも、現実的なテクスチャを生成可能である。

実験結果

リサーチクエスチョン

  • RQ1誤差の明示的パラメトリックモデルを必要とせずに、学習された敵対的損失をRGB-Dスキャンにおける一般的なズレに対して頑健にできるか?
  • RQ2L1/L2または知覚的損失に基づく従来手法と比較して、敵対的テクスチャ最適化はシャープネスとリアルさの面でどのように優れているか?
  • RQ3本手法は、実スキャンに粗くアライメントされたCADモデルに対しても高品質なテクスチャを生成できるか?
  • RQ4識別器がズレに一般化できる能力が、ベースライン最適化目的関数と比較して、テクスチャ品質にどの程度向上効果をもたらすか?
  • RQ5ノイズの多い幾何構造や正確でないカメラポーズといった実世界のスキャン誤差下でも、本手法はどの程度の性能を示すか?

主な発見

  • 実物のオブジェクトスキャンでは、本手法が最小の知覚的損失(0.175)を達成し、L1(0.197)、ColorMap(0.186)、Sharpest(0.222)、3DLite(0.185)、VGG(0.272)を上回った。
  • ScanNetのシーンスキャンでは、本手法が知覚的損失0.395を達成し、次善の手法(3DLite:0.445)を著しく下回った。
  • 幾何的ズレが大きいCADモデルでは、本手法が知覚的損失0.176を達成し、すべてのベースライン(VGG:0.289)を上回った。
  • 63名の参加者によるユーザースタディでは、入力画像に最も近いレンダリングを生成するという点で、本手法がすべてのベースラインを上回った。
  • 特に深刻なズレがある状況でも、最先端のアプローチと比較して、ぼやけやノイズ、シームアーチファクトが少ないよりシャープなテクスチャを生成した。
  • 本フレームワークは、1台のTITAN X GPUで1オブジェクトあたり7.3分、1シーンあたり33.4分で実行可能であり、実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。