Skip to main content
QUICK REVIEW

[論文レビュー] Semantic White Balance: Semantic Color Constancy Using Convolutional Neural Network

Mahmoud Afifi|arXiv (Cornell University)|Feb 1, 2018
Color Science and Applications参考文献 10被引用数 14
ひとこと要約

本稿では、畳み込みニューラルネットワーク(CNN)を活用して、RGB画像データとセマンティックセグメンテーションマスクを統合することで、色のつり合いを向上させる意味的ホワイトバランス手法を提案する。空間的および意味的情報を組み合わせて、変更されたAlexNetを用いて照明白色とガンマ補正パラメータを推定することで、意味的ベースラインと比較して色補正誤差を40%以上低減し、意味的文脈が照明白推定の正確性を顕著に向上させることを示している。

ABSTRACT

The goal of computational color constancy is to preserve the perceptive colors of objects under different lighting conditions by removing the effect of color casts caused by the scene's illumination. With the rapid development of deep learning based techniques, significant progress has been made in image semantic segmentation. In this work, we exploit the semantic information together with the color and spatial information of the input image in order to remove color casts. We train a convolutional neural network (CNN) model that learns to estimate the illuminant color and gamma correction parameters based on the semantic information of the given image. Experimental results show that feeding the CNN with the semantic information leads to a significant improvement in the results by reducing the error by more than 40%.

研究の動機と目的

  • 意味的情報を深層学習モデルに統合することで、計算色のつり合いを向上させること。
  • 色と空間統計に依存する従来の色のつり合い手法の限界に対処すること。
  • セマンティックセグメンテーションマスクが、CNNベースのホワイトバランスシステムにおける照明白推定の正確性を向上させることを調査すること。
  • 不正確または誤ったセマンティックマスクを用いた場合の手法のロバストネスを評価すること。
  • 意味的認識CNNを用いた照明白とガンマ補正の共同学習の有効性を示すこと。

提案手法

  • 入力画像をRGBチャンネルとセマンティックマスクを組み合わせた4次元ボリュームとして表現し、ネットワークが色と意味的コンテンツを同時に処理できるようにする。
  • 4次元入力テンソルを処理できるように、最初の層に4次元畳み込み層を導入した変更版AlexNetアーキテクチャを用いる。
  • 全結合層を4つの新しい層(fc6–fc9)に再構築し、その後に回帰ヘッドを配置して、赤、緑、青の照明白成分(r, g, b)およびガンマ補正(γ)の4つのパラメータを予測する。
  • 画像補正は次の式で行う:ŝ = (I × M)^(1/γ),ここでMは照明白成分の逆行列である対角行列である。
  • モデルは、ADE20Kデータセットの実際のsRGB画像にランダムな色補正(r, g, b ∈ [0.7, 1.3])とガンマ補正(γ ∈ [0.85, 1.15])を適用して生成した合成データを用いて学習する。
  • データ拡張には空間変換を用い、トレーニングデータを豊かにし、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1CNNにセマンティックセグメンテーションマスクを統合することで、色のつり合いのための照明白推定の正確性が向上するか?
  • RQ2RGBと空間特徴のみを用いるモデルと比較して、意味的コンテキストの組み込みが、深層学習ベースのホワイトバランスモデルの性能に与える影響はいかほどか?
  • RQ3不正確またはノイズの多いセマンティックマスクを用いた場合、モデルの性能がどの程度低下するか?
  • RQ4照明白とガンマ補正を同時に推定することで、分離的または固定パラメータ補正と比較して、視覚的および定量的結果が改善するか?
  • RQ5制御された色補正を施した合成データで学習したCNNは、実世界のsRGB画像に効果的に一般化できるか?

主な発見

  • 提案手法は、意味的入力を含まないベースラインCNNと比較して、平均二乗誤差(RMSE)を40%以上低減し、ADE20Kテストセット全体でRMSE 31.1355(ベースライン:53.8815)を達成した。
  • ガンマ補正が不要な場合(γ = 1)には、誤差低減がさらに顕著で、誤差は51.8160から20.1450に低下し、クリーンなケースにおける優れた性能を示した。
  • 定性的な結果から、本手法はグレー・ワールド、Adobe Photoshopの自動補正、Lightroom、および標準AlexNetベースラインと比較して、視覚的に優れた補正を実現した。
  • 図6に示すように、誤ったセマンティックマスクを入力しても、本手法は依然として意味的でないベースラインより優れた結果を維持しており、誤りに強い性能を示した。
  • 図4に示すように、本手法はNUSおよびGehlerデータセットにおいて、グレー・ワールド、ホワイト・パッチ、PCAベースの照明白推定といった従来のアルゴリズムを上回った。
  • セマンティックマスクの使用により、ネットワークは事前知識(例:空は青でなければならない)を活用でき、照明白推定におけるロバスト性と正確性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。