Skip to main content
QUICK REVIEW

[論文レビュー] Aesthetic-Driven Image Enhancement by Adversarial Learning

Yubin Deng, Chen Change Loy|arXiv (Cornell University)|Jul 17, 2017
Image Enhancement Techniques参考文献 33被引用数 8
ひとこと要約

本稿では、入力画像とプロフェッショナルが処理した画像のペairedデータを一切必要とせず、単一の美的質のバイナリーラベル(良し/悪い)のみを用いて自動画像強調を行う弱教師付き生成対抗ネットワーク、EnhanceGANを提案する。生成器が識別器に高品質と分類させることで偽装するように訓練されることで、モデルはエンドツーエンドで効果的な色彩強調およびクロッピング方針を学習し、ユーザー評価ではプロフェッショナル編集と同等の結果を達成し、ベンチマークデータセットでも競争力のある性能を示した。

ABSTRACT

We introduce EnhanceGAN, an adversarial learning based model that performs automatic image enhancement. Traditional image enhancement frameworks typically involve training models in a fully-supervised manner, which require expensive annotations in the form of aligned image pairs. In contrast to these approaches, our proposed EnhanceGAN only requires weak supervision (binary labels on image aesthetic quality) and is able to learn enhancement operators for the task of aesthetic-based image enhancement. In particular, we show the effectiveness of a piecewise color enhancement module trained with weak supervision, and extend the proposed EnhanceGAN framework to learning a deep filtering-based aesthetic enhancer. The full differentiability of our image enhancement operators enables the training of EnhanceGAN in an end-to-end manner. We further demonstrate the capability of EnhanceGAN in learning aesthetic-based image cropping without any groundtruth cropping pairs. Our weakly-supervised EnhanceGAN reports competitive quantitative results on aesthetic-based color enhancement as well as automatic image cropping, and a user study confirms that our image enhancement results are on par with or even preferred over professional enhancement.

研究の動機と目的

  • 高価なペアデータ(例:入力画像とプロフェッショナルが処理した画像)を必要としない自動画像強調手法の開発。
  • 入力画像と強調済み画像のペアではなく、バイナリーラベル(良し/悪い)のみを用いた教師信号としての、エンドツーエンドの画像強調モデルの訓練。
  • 敵対的学習を可能にする完全微分可能な強調演算子(例:分離的色彩強調、ディープフィルタリング)の設計。
  • 教師付きクロッピングペアを必要としない自動画像クロッピングへのフレームワークの拡張。
  • 定量的指標と人間評価を通じたモデル性能の検証により、プロフェッショナル編集と同等の結果を示すこと。

提案手法

  • 生成対抗ネットワーク(GAN)フレームワークを用い、生成器が低美的質の画像を強調し、識別器が美的判断に基づき画像を高品質または低品質に分類する。
  • 生成器は、エンドツーエンドの誤差逆伝播を可能にする2つの完全微分可能な強調モジュール(分離的色彩強調とディープフィルタリングベースの強調)を採用する。
  • 弱教師付き学習を用い、画像が美的に良いか悪いかを示すバイナリーラベルのみを必要とする。
  • 識別器は、大規模な美的データセット(例:Murray et al., 2012; Tang et al., 2013)を事前学習して、高品質と低品質の画像を区別できるようにする。
  • 生成器は、識別器が「高品質」と予測する信頼度を最大化するように最適化される。
  • 教師付きクロッピングペアを必要としない自動画像クロッピングへの拡張は、生成器が最適なクロップ領域を予測するように訓練することで実現する。

実験結果

リサーチクエスチョン

  • RQ1ペアデータ(入力画像と強調済み画像)を用いずに、バイナリーラベル(良し/悪い)のみで画像強調を効果的に学習できるか?
  • RQ2弱教師付きのGANフレームワークにより、プロフェッショナル編集と同等の画像強調結果を得られるか?
  • RQ3完全微分可能な強調演算子(例:分離的色彩、ディープフィルタリング)が敵対的学習環境でエンドツーエンド学習に有効に適用できるか?
  • RQ4同じフレームワークを教師付きクロッピングペアを必要とせずに、自動画像クロッピングに拡張できるか?
  • RQ5弱教師付きのEnhanceGANは、定量的指標および人間評価において、完全教師付き手法と比較してどの程度の性能を示すか?

主な発見

  • ユーザー評価において、分離的色彩強調とディープフィルタリングベースの強調は、それぞれ平均美的スコア5.189および5.289を達成し、Photoshop-Autoの出力よりも高く、人間編集のスコア5.232に近づいた。
  • ユーザー評価では、EnhanceGANの出力がプロフェッショナル版のPhotoshop出力よりも「最良」または「優れた出来栄え」としてより頻繁に評価され、一部の画像では人間編集を上回ることもあった。
  • CUHK Image Cropping Datasetにおいて、弱教師付きのEnhanceGANは3人のフォトグラファーの平均オーバーラップ比0.715(0.701、0.702)を達成し、既存の弱教師付き手法を上回った。
  • 微調整を施したEnhanceGANは、オーバーラップ比0.828(0.805、0.798)を達成し、SOTA性能を示し、完全教師付きベースラインに近づいた。
  • モデルはカテゴリに跨って一貫した強調を示した:空と海の風景画像は補色の色彩構成へと強調され、他の画像では三色対、分割補色の調和が見られた。
  • 視覚的結果から、盲検比較においてEnhanceGANの強調結果は人間編集と区別がつかず、テストデータセット内のいかなる画像も明確にモデル生成と識別できなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。