Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Learning for Intrinsic Image Decomposition from a Single Image

Yunfei Liu, Li Yu|arXiv (Cornell University)|Nov 22, 2019
Image Enhancement Techniques参考文献 38被引用数 6
ひとこと要約

本論文は、ラベル付きデータや手作業で作成された事前知識に依存せずに、対応のとられていない、相関のない自然画像から反射率と照 shade を学習する、画期的な教師なし単一画像内在的画像分解フレームワークを提案する。物理的整合性、ドメイン不変なコンテンツ、反射率-照 shade の独立性を強制することで、複数のベンチマークで最先端の性能を達成し、既存の教師なし手法を上回り、教師あり手法と同等の性能を示す。

ABSTRACT

Intrinsic image decomposition, which is an essential task in computer vision, aims to infer the reflectance and shading of the scene. It is challenging since it needs to separate one image into two components. To tackle this, conventional methods introduce various priors to constrain the solution, yet with limited performance. Meanwhile, the problem is typically solved by supervised learning methods, which is actually not an ideal solution since obtaining ground truth reflectance and shading for massive general natural scenes is challenging and even impossible. In this paper, we propose a novel unsupervised intrinsic image decomposition framework, which relies on neither labeled training data nor hand-crafted priors. Instead, it directly learns the latent feature of reflectance and shading from unsupervised and uncorrelated data. To enable this, we explore the independence between reflectance and shading, the domain invariant content constraint and the physical constraint. Extensive experiments on both synthetic and real image datasets demonstrate consistently superior performance of the proposed method.

研究の動機と目的

  • 高価または現実的でない反射率および照 shade のアノテーションを必要とせずに、自然画像における内在的画像分解の課題に対処すること。
  • 合成データや手作業でアノテートされたデータセットに依存する教師あり手法の限界を克服し、実世界への一般化能力を向上させること。
  • 教師なしの完全なフレームワークを構築し、対応のとられていない、相関のない自然画像の集合を活用して、教師なしで内在的成分を学習すること。
  • 物理的整合性、ドメイン不変なコンテンツ、反射率-照 shade の独立性という3つの重要な物理的制約を導入・強制し、教師なし学習をガイドすること。

提案手法

  • 内在的画像分解を、コンテンツを保存する画像変換タスクとして定式化し、自然画像を反射率および照 shade ドメインに変換するが、元のコンテンツを保持する。
  • 反射率と照 shade の分離表現を学習するため、共有エンコーダーおよびデコーダーを持つ条件付き生成対抗ネットワーク(cGAN)を用いる。
  • 物理的整合性を制約 $ I = R(I) \bigodot S(I) $ により強制し、予測された反射率と照 shade の積が入力画像を再構成することを保証する。
  • ドメイン不変なコンテンツ制約を適用し、自然画像、反射率、照 shade ドメイン間で、物体のレイアウト、幾何構造、構造が保持されることを保証する。
  • 反射率-照 shade の独立性を、反射率を照度に依存しないもの、照 shade を照度に依存するものとしてモデル化し、潜在空間における統計的独立性を用いて強制する。
  • 反射率の滑らかさ損失 $ \\_R^{smooth} $ を統合し、反射率を局所的に定数とするよう促進する。空間的および色彩性特徴を用い、学習された共分散行列を活用する。

実験結果

リサーチクエスチョン

  • RQ1教師付きの反射率や照 shade のデータが一切ない状態でも、完全に教師なしで内在的画像分解を効果的に学習できるか?
  • RQ2反射率-照 shade の独立性や物理的整合性といった物理的事前知識を、教師なしの深層学習フレームワークにどのように組み込むことができるか?
  • RQ3単一画像教師なし手法が、実世界のベンチマークで教師あり手法と同等またはそれ以上の性能を達成できるか?
  • RQ4自然シーンから得られる対応のとられていない、相関のない画像の集合が、内在的画像成分の学習の代理としてどれほど有効に機能するか?

主な発見

  • MIT Intrinsic Dataset において、反射率と照 shade の平均の MSE が 0.0146 と、教師なし手法の中で最高の性能を達成した。
  • IIW ベンチマークでは WHDR 18.69% を達成し、他のすべての教師なし手法を上回り、教師ありの最先端手法に近い性能を示した。
  • 定性的な比較において、MUNIT や LS18、WH18 と比較して、特に物体の境界やテクスチャの詳細をより鋭く正確に再現する反射率および照 shade マップを生成した。
  • アブレーションスタディにより、物理的整合性、ドメイン不変なコンテンツ、反射率-照 shade の独立性という3つの制約が性能向上に不可欠であることが確認され、それらを除去すると顕著な性能低下が生じた。
  • 訓練中に真値データにアクセスしないにもかかわらず、IIW および MIT データセットでの強力な結果から、実世界のシーンへの一般化性能が優れていることが示された。
  • 反射率の滑らかさ損失は、特に段階的な照度変化が生じる領域において、知覚的な品質を著しく向上させ、反射率マップのノイズを低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。