Skip to main content
QUICK REVIEW

[論文レビュー] Deep Structured-Output Regression Learning for Computational Color Constancy

Yanlin Qian, Ke Chen|arXiv (Cornell University)|Jul 13, 2016
Color Science and Applications参考文献 48被引用数 9
ひとこと要約

この論文は、事前学習済みのVGGおよびAlexNetネットワークの全結合層からの特徴を活用して、計算色常体のためのシーンの照度を推定する、深層構造的出力回帰フレームワークを提案する。複数出力サポートベクタ回帰(MSVR)を用いてチャネル間相関をモデル化することで、SFU Indoorベンチマークにおいて中央値角誤差1.64°という最先端の性能を達成し、VGGがAlexNetを上回ること、およびfc6がfc7/fc8を上回ることを示した。

ABSTRACT

Computational color constancy that requires esti- mation of illuminant colors of images is a fundamental yet active problem in computer vision, which can be formulated into a regression problem. To learn a robust regressor for color constancy, obtaining meaningful imagery features and capturing latent correlations across output variables play a vital role. In this work, we introduce a novel deep structured-output regression learning framework to achieve both goals simultaneously. By borrowing the power of deep convolutional neural networks (CNN) originally designed for visual recognition, the proposed framework can automatically discover strong features for white balancing over different illumination conditions and learn a multi-output regressor beyond underlying relationships between features and targets to find the complex interdependence of dif- ferent dimensions of target variables. Experiments on two public benchmarks demonstrate that our method achieves competitive performance in comparison with the state-of-the-art approaches.

研究の動機と目的

  • 色常体の不十分な制約性に対処するため、画像特徴からシーンの照度を推定すること。
  • チャネル間相関をモデル化することで照度推定を改善し、単一出力手法が捉えられない相関を補完すること。
  • エンドツーエンドの色常体に適した深層CNN特徴(特にVGGおよびAlexNet)の有効性を評価すること。
  • 照度推定に最適なCNN層(fc6, fc7, fc8)および回帰器(MSVR, MRR, RR)を特定すること。
  • エンドツーエンドCNN回帰とハイブリッドCNN+構造的回帰フレームワークの性能を比較すること。

提案手法

  • 事前学習済みのVGGおよびAlexNetの全結合層活性化(fc6, fc7, fc8)を深層視覚特徴として使用する。
  • 照度推定は、赤、緑、青チャネルの予測間の相関をモデル化する複数出力サポートベクタ回帰(MSVR)により実行される。
  • フレームワークは、CNNによる特徴抽出とMSVRによる回帰を分離することで、高レベル表現における構造的出力学習を可能にする。
  • ランダムおよび定期的なパッチ抽出によるデータ拡張を実施してトレーニングの多様性を向上させるが、過学習を引き起こし性能が低下する。
  • 主に角誤差を指標として用い、SFU Color CheckerおよびSFU Indoorの2つのベンチマークで評価を行う。
  • 構造的出力モデル化の利点を評価するため、単一出力SVR、リッジ回帰(RR)、複数出力リッジ回帰(MRR)と比較する。

実験結果

リサーチクエスチョン

  • RQ1照度推定においてチャネル間相関をモデル化することで、単一出力回帰と比較して性能が向上するか?
  • RQ2事前学習済みCNNアーキテクチャ(VGG対AlexNet)のどちらが照度推定に適した特徴を提供するか?
  • RQ3全結合層(fc6, fc7, fc8)のうち、色常体に最も特徴的な特徴を提供するのはどれか?
  • RQ4ハイブリッドCNN+構造的回帰フレームワークは、エンドツーエンドCNN回帰を上回る性能を示すか?
  • RQ5パッチ抽出によるデータ拡張は、照度推定における一般化性能と性能にどのように影響するか?

主な発見

  • VGGは両ベンチマークでAlexNetを上回り、SFU Color Checkerでは中央値誤差が0.7–0.9低下し、SFU Indoorでは0.35低下した。
  • 最高の性能はfc6層で達成され、より深い層(fc7, fc8)では低レベルの視覚的手がかりの損失により性能が低下した。
  • 複数出力SVR(MSVR)は単一出力SVRを著しく上回り、チャネル間相関をモデル化することが重要であることを示した。
  • CNN+MSVRフレームワークはSFU Indoorベンチマークで中央値角誤差1.64°を達成し、最先端の性能を示した。
  • パッチ抽出によるデータ拡張は過学習を引き起こし、提案されたCNN+MSVRフレームワークよりも性能が悪化した。
  • VGG特徴とMSVRの組み合わせが最良の結果をもたらし、SFU Color Checkerでは平均誤差4.29、SFU Indoorでは3.25を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。