Skip to main content
QUICK REVIEW

[論文レビュー] Single Image BRDF Parameter Estimation with a Conditional Adversarial Network

Mark Boss, Hendrik P. A. Lensch|arXiv (Cornell University)|Oct 11, 2019
Computer Graphics and Visualization Techniques被引用数 4
ひとこと要約

本論文は、1枚のスマートフォンのフラッシュ写真から空間的に変化するBRDFパrameter(拡散色、法線、粗さ、金属性)を推定する条件付き生成対抗ネットワーク(cGAN)を提案する。マルチスケールディスクライマ、知覚的損失、微分可能レンダリング、パrameter正則化を活用することで、高解像度でグローバルに一貫性のあるマテリアルマップを生成し、手作業で作成されたスタイルに類似させつつ、フラッシュのハイライトや二次照明に起因するアーティファクトを低減する。

ABSTRACT

Creating plausible surfaces is an essential component in achieving a high degree of realism in rendering. To relieve artists, who create these surfaces in a time-consuming, manual process, automated retrieval of the spatially-varying Bidirectional Reflectance Distribution Function (SVBRDF) from a single mobile phone image is desirable. By leveraging a deep neural network, this casual capturing method can be achieved. The trained network can estimate per pixel normal, base color, metallic and roughness parameters from the Disney BRDF. The input image is taken with a mobile phone lit by the camera flash. The network is trained to compensate for environment lighting and thus learned to reduce artifacts introduced by other light sources. These losses contain a multi-scale discriminator with an additional perceptual loss, a rendering loss using a differentiable renderer, and a parameter loss. Besides the local precision, this loss formulation generates material texture maps which are globally more consistent. The network is set up as a generator network trained in an adversarial fashion to ensure that only plausible maps are produced. The estimated parameters not only reproduce the material faithfully in rendering but capture the style of hand-authored materials due to the more global loss terms compared to previous works without requiring additional post-processing. Both the resolution and the quality is improved.

研究の動機と目的

  • 1枚のスマートフォン画像による低コストで非公式な撮影から、高品質な空間的に変化するBRDFを取得する課題に対処すること。
  • フラッシュや環境照明に起因するアーティファクトを低減し、現実的なマテリアル外観を強制することで、単一画像からのBRDF推定という不適切に定義された問題を克服すること。
  • 後処理や事前知識を必要としない従来の手法を改善し、新しい損失定式化により、鏡面反射アーティファクトと二次照明を抑制する学習を可能にすること。
  • プロフェッショナルなビデオゲームや映画制作に必要な品質を満たす高解像度(512×512)のBRDFパrameter予測を正確に実現すること。
  • Substance Designerなどのツールで作成された手作業マテリアルのスタイル的一致性を反映する予測マップを、追加の精錬を必要とせずに実現すること。

提案手法

  • 生成器ネットワークを用いて、Disney BRDFモデルに基づき、ピクセルごとに8つのBRDFパラメータ(拡散色:3チャンネル、法線:3チャンネル、粗さ:1チャンネル、金属性:1チャンネル)を予測する条件付きGANを訓練する。
  • マルチスケールディスクライマを用いて、予測されたパラメータマップの局所的およびグローバルな一貫性を強制し、鏡面ハイライトや不均一な照明に起因するアーティファクトを低減する。
  • 事前学習済みのVGGネットワークに基づく知覚的損失を統合し、予測されたマテリアルの視覚的リアリズムと構造的一致性を向上させる。
  • 微分可能レンダラを用いてレンダリング損失を計算し、予測されたBRDFが同じ照明条件下で入力画像を再現することを保証する。
  • パラメータ損失を適用して、予測されたBRDFパラメータを正則化し、物理的妥当性を保ちながら出力マップのノイズを低減する。
  • 実際のスマートフォン撮影条件を模倣するため、変化する環境照明を備えた40,544枚の手続き的生成マテリアルからなる大規模な合成データセットで学習を行う。

実験結果

リサーチクエスチョン

  • RQ1制御された照明や複数の視点を必要とせず、1枚のフラッシュ照明付きスマートフォン画像から、空間的に変化するBRDFパラメータを信頼性高く推定できるか?
  • RQ2マルチスケールディスクライマを備えたGANベースのアプローチは、最適化ベースやオートエンコーダベースの手法と比較して、過酷なフラッシュ反射や二次照明などのアーティファクトをどれほど効果的に低減できるか?
  • RQ3知覚的損失とレンダリング損失を組み込むことで、純粋にピxls単位の損失に比べて、予測されたBRDFマップの視覚的品質とスタイル的一致性がどの程度向上するか?
  • RQ4先行研究よりも高い解像度(512×512)のBRDFマップを実現しながら、忠実度を維持し、アーティファクトを低減できるか?
  • RQ5制御された照明と環境マップを用いた合成データのみで学習したにもかかわらず、本手法は現実世界のマテリアルに十分に一般化できるか?

主な発見

  • 提案手法は、先行研究と比較して4倍の解像度を達成し、顕著な詳細を有する512×512のBRDFパラメータマップを生成する。
  • マルチスケールGAN損失により、フラッシュハイライトや二次照明に起因する目立つアーティファクトが低減され、Deschaintreら(2018年)およびLiら(2017年)との視覚的比較で明確に示された。
  • 知覚的損失とレンダリング損失の統合により、Substance Designerから得られる手作業マテリアルのスタイルをよりよく模倣するグローバルに一貫性のあるパラメータマップが得られる。
  • 本手法は、従来の手法でよく見られるコーナー部の光の減衰などの二次照明効果を効果的に除去し、粗さと拡散マップの正確性が向上した。
  • 制御されていない照明条件に対しても、合成データのみで学習したにもかかわらず、本ネットワークは現実世界のマテリアルに良好に一般化しており、頑健性を示した。
  • パラメータ損失の導入により、粗さと金属性の値におけるノイズや現実的でない変動が低減され、予測されたBRDFの物理的妥当性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。