Skip to main content
QUICK REVIEW

[論文レビュー] Faces as Lighting Probes via Unsupervised Deep Highlight Extraction

Renjiao Yi, Chenyang Zhu|arXiv (Cornell University)|Mar 16, 2018
Advanced Vision and Imaging参考文献 36被引用数 5
ひとこと要約

本稿では、単一の画像における人間の顔から鏡面反射を非教師付きで抽出し、それをライティングプローブとして用いて高精度で非パrametricな環境マップを推定する深層学習手法を提案する。同じ顔の複数枚の実画像における拡散色度の低ランク性を活用することで、顔のハイライトアノテーションが不要な状態でモデルをファインチューニング可能であり、ライティング推定および光源トリアングレーションの分野で最先端の性能を達成している。

ABSTRACT

We present a method for estimating detailed scene illumination using human faces in a single image. In contrast to previous works that estimate lighting in terms of low-order basis functions or distant point lights, our technique estimates illumination at a higher precision in the form of a non-parametric environment map. Based on the observation that faces can exhibit strong highlight reflections from a broad range of lighting directions, we propose a deep neural network for extracting highlights from faces, and then trace these reflections back to the scene to acquire the environment map. Since real training data for highlight extraction is very limited, we introduce an unsupervised scheme for finetuning the network on real images, based on the consistent diffuse chromaticity of a given face seen in multiple real images. In tracing the estimated highlights to the environment, we reduce the blurring effect of skin reflectance on reflected light through a deconvolution determined by prior knowledge on face material properties. Comparisons to previous techniques for highlight extraction and illumination estimation show the state-of-the-art performance of this approach on a variety of indoor and outdoor scenes.

研究の動機と目的

  • 人間の顔をライティングプローブとして用い、単一画像から高周波数で非パrametricなシーンライティングを推定する課題に取り組む。
  • 同じ顔の複数枚の画像における拡散色度の低ランク性を活用することで、ハイライト分離に必要な実世界のアノテーションが欠如している問題を克服する。
  • 低次の球面調和関数や拡散成分のみの仮定に依存する従来手法を改善し、詳細で高周波数のライティングを回復する。
  • 単一画像内の複数の顔から推定された環境マップを用いて、局所的な点光源の3次元位置を正確に特定可能にする。

提案手法

  • グラフィックスでレンダリングされたアノテーション付きの合成顔画像を用いて、深層ニューラルネットワークを訓練し、鏡面反射と拡散反射を分離する。
  • 同じ人物の複数枚のアラインされた実画像にわたる拡散色度の低ランク制約を用いて、非教師付きのファインチューニングを実施する。
  • 回復されたハイライトを、皮膚の反射特性に関する事前知識を反映したデコンボリューション処理を用いて環境に戻すことで、皮膚の反射によるぼやけを低減する。
  • 周波数ドメインにおけるデコンボリューションにより、既知の顔の反射モデルから得られるカーネルを用いて、高周波数のライティング成分を回復する。
  • 単一画像内の複数の顔から推定された環境マップを用いて、局所的光源の3次元位置をトリアングレーションで推定する。
  • キャプチャ済みのHDR環境マップを用いた合成シーンを用いて手法を検証し、リライト誤差および光源位置特定精度において最先端の手法と比較する。

実験結果

リサーチクエスチョン

  • RQ1実画像内の顔を、ハイライトアノテーションが存在しない状態で、高精度で非パrametricな環境マップを推定するためのライティングプローブとして効果的に使用できるか?
  • RQ2非教師付き学習は、同じ顔の複数枚の画像における拡散色度の低ランク性をどのように活用し、実データにおけるハイライト抽出を改善できるか?
  • RQ3材料に依存するカーネルを用いたデコンボリューションは、標準的な畳み込みベースのアプローチと比較して、高周波数のライティング詳細の回復をどの程度向上させるか?
  • RQ4単一画像内の複数の顔を用いて、1m未満の精度で局所的光源の3次元位置をトリアングレーションできるか?

主な発見

  • クロスポラリゼーションのアノテーション付きデータを用いた検証により、教師あり学習に比べ、非教師付きファインチューニング戦略がハイライト分離性能を顕著に向上させた。
  • 屋内および屋外の両シーンにおいて、球面調和関数ベースや拡散成分のみの仮定に基づく手法、および顔データで訓練されていない手法を上回る最先端のリライト誤差を達成した。
  • 推定された環境マップは、低次の球面調和関数や拡散成分のみのモデルよりも高周波数のライティング詳細をより正確に回復しており、後者では過剰に白くまたはぼやけたアルベド推定が生じる傾向がある。
  • 本手法により、局所的光源の位置を正確にトリアングレーション可能であり、位置誤差は0.41mおよび0.51mであったが、アノテーション付き顔の位置を用いると0.20mおよび0.49mにまで低減された。
  • 本手法は、多様な屋内および屋外シーン、特に従来手法が方向性の光源を捉えきれない複雑なライティング環境においても、良好な汎化性能を示した。
  • 推定されたライティングを用いた仮想オブジェクトの挿入では、ベースライン手法に比べて影の過剰発生や色の不一致が低減され、よりフォトリアルな結果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。