Skip to main content
QUICK REVIEW

[論文レビュー] Deep Hybrid Real and Synthetic Training for Intrinsic Decomposition

Sai Bi, Nima Khademi Kalantari|ArXiv.org|Jul 30, 2018
Advanced Vision and Imaging参考文献 25被引用数 19
ひとこと要約

本論文は、合成画像と実画像の両方を用いて畳み込みニューラルネットワーク(CNN)を訓練するハイブリッドディープラーニングアプローチを提案する。実画像ペアからの照度不変の反射率を活用することで、シミュレーションから実世界へのドメインギャップを埋める。この手法は、実画像において最先端の性能を達成し、WHDRやsi-MSEといった定量的指標および視覚的品質の両面で、合成データのみまたは実データのみで訓練されたベースラインを上回る。

ABSTRACT

Intrinsic image decomposition is the process of separating the reflectance and shading layers of an image, which is a challenging and underdetermined problem. In this paper, we propose to systematically address this problem using a deep convolutional neural network (CNN). Although deep learning (DL) has been recently used to handle this application, the current DL methods train the network only on synthetic images as obtaining ground truth reflectance and shading for real images is difficult. Therefore, these methods fail to produce reasonable results on real images and often perform worse than the non-DL techniques. We overcome this limitation by proposing a novel hybrid approach to train our network on both synthetic and real images. Specifically, in addition to directly supervising the network using synthetic images, we train the network by enforcing it to produce the same reflectance for a pair of images of the same real-world scene with different illuminations. Furthermore, we improve the results by incorporating a bilateral solver layer into our system during both training and test stages. Experimental results show that our approach produces better results than the state-of-the-art DL and non-DL methods on various synthetic and real datasets both visually and numerically.

研究の動機と目的

  • 合成データで訓練されたディープラーニングモデルが実画像に適用された際に生じる分布ギャップにより、ドメインシフト問題が顕在化する内在的画像分解の問題に対処すること。
  • IIWデータセットからの相対的反射率比較という弱い教師信号に依存する既存の実データ手法の限界を克服すること。
  • ネットワークに統合されたエンドツーエンドで学習可能なバイラテラルソルバーレイヤーを用いて、反射率予測の空間的整合性と視覚的品質を向上させること。
  • 実画像の真値反射率が不要な状態で、合成データと実データのハイブリッドトレーニングにより、実世界のシーンへの優れた一般化性能を実現すること。

提案手法

  • 合成画像に真値の反射率とシェーディングを教師信号として用いてCNNを訓練する。
  • 同一シーンを異なる照度で撮影した実画像ペアを用いた、新たな自己教師型損失を導入し、同一の反射率予測を強制する。
  • トレーニングおよび推論の両段階で、空間的整合性を向上させるために、微分可能で学習可能なバイラテラルソルバーレイヤーをネットワークに統合する。
  • 合成データにおける教師信号損失と実画像ペアにおける一貫性損失の両方を組み合わせ、ネットワーク全体をエンドツーエンドで最適化する。
  • 合成ベンチマークで性能を検証するため、スケール不変MSE(si-MSE)および局所的si-MSEを評価指標として用いる。
  • すべてのデータセットに対して、シーンごとのチューニングを一切行わず、同一のネットワークアーキテクチャとハイパーパrameterを適用することで、公平な比較を確保する。

実験結果

リサーチクエスチョン

  • RQ1合成データで訓練されたディープCNNは、内在的画像分解において実世界の画像に効果的に一般化できるか、それともドメインシフトが性能を著しく低下させるか?
  • RQ2照度が異なる実世界の画像ペアを、明示的な真値がなくても弱い教師信号として用いることで、一般化性能の向上が可能か?
  • RQ3微分可能なバイラテラルソルバーレイヤーの統合により、予測された反射率マップの空間的整合性と視覚的品質が向上するか?
  • RQ4合成データと実データのハイブリッドトレーニング戦略は、合成データまたは実データに特化した手法を上回る性能を発揮するか?
  • RQ5本手法は、多様な実画像および合成データセットにおいて、数値的および視覚的に最先端の学習ベースおよび非学習ベースの手法と比較して、どのように差をつけるか?

主な発見

  • 提案手法は、IIWデータセットにおいて、比較対象のすべての手法の中で最低のWHDRスコア(0.114)を達成し、Narihiraら(0.135)やShiら(0.140)といった合成データのみのベースラインを顕著に上回った。
  • Sintel合成データセットでは、反射率のsi-MSEが2.02 × 10⁻²、シェーディングのsi-MSEが1.84 × 10⁻²を達成し、Narihiraら(2.01および2.24)および他のすべての手法を上回った。
  • Bonneel合成データセットでは、反射率のsi-MSEが5.02 × 10⁻²、シェーディングのsi-MSEが6.61 × 10⁻²を達成し、NarihiraらやNestmeyerらを含むすべての競合手法を上回った。
  • 視覚的比較では、複雑なシェーディングを含むシーンにおいて、競合手法に比べてより鋭い反射率マップを生成し、アーティファクトが少なく、テクスチャの保持が優れていた。
  • バイラテラルソルバーレイヤーは空間的整合性を著しく向上させ、不連続性を低減し、ノイズを平滑化しながらも微細なディテールを保持した。
  • 明示的な真値が不要な自己教師型実データのみを用いても、合成および実データのベンチマークで最先端の性能を達成した。これは、強力な一般化性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。