Skip to main content
QUICK REVIEW

[論文レビュー] Creatism: A deep-learning photographer capable of creating professional work

Hui Fang, Meng Zhang|arXiv (Cornell University)|Jul 11, 2017
Advanced Image and Video Retrieval Techniques参考文献 20被引用数 13
ひとこと要約

Creatism は、ラベルなしの学習アプローチを用いて、構図、照明、色彩といった複数の独立した美的側面を学習することで、プロフェッショナルレベルの写真を生成するディーブラーニングシステムである。Google ストリートビューのシミュレーテッド環境を用い、'ドラマティックマスク' などの最適化された画像処理を適用することで、盲検テストに類似した評価において、41.4%のプロフェッショナル写真家が半プロからプロレベルと評価した結果を得た。

ABSTRACT

Machine-learning excels in many areas with well-defined goals. However, a clear goal is usually not available in art forms, such as photography. The success of a photograph is measured by its aesthetic value, a very subjective concept. This adds to the challenge for a machine learning approach. We introduce Creatism, a deep-learning system for artistic content creation. In our system, we break down aesthetics into multiple aspects, each can be learned individually from a shared dataset of professional examples. Each aspect corresponds to an image operation that can be optimized efficiently. A novel editing tool, dramatic mask, is introduced as one operation that improves dramatic lighting for a photo. Our training does not require a dataset with before/after image pairs, or any additional labels to indicate different aspects in aesthetics. Using our system, we mimic the workflow of a landscape photographer, from framing for the best composition to carrying out various post-processing operations. The environment for our virtual photographer is simulated by a collection of panorama images from Google Street View. We design a "Turing-test"-like experiment to objectively measure quality of its creations, where professional photographers rate a mixture of photographs from different sources blindly. Experiments show that a portion of our robot's creation can be confused with professional work.

研究の動機と目的

  • ラベル付きの前後画像ペアや明示的な美的ラベルに依存せずに、プロフェッショナルレベルの写真を生成できるディーブラーニングシステムの開発。
  • 美的品質を、構図、照明、色彩といった特定の視覚的側面にそれぞれ最適化された複数の部分的に直交する画像処理に分解し、独立して最適化すること。
  • プロフェッショナル写真家がロボット生成と人間生成の写真を確実に区別できないような「チューリングテスト」に類似した実験によるシステムの評価。
  • ラベルなしデータから自己教師学習によって学習可能な、'ドラマティックマスク' と呼ばれる新しい画像処理を導入し、高コントラストでドラマチックな照明効果を強化すること。
  • 客観的で盲検のペアレビューを通じて、機械生成画像が半プロからプロの美的基準に達していることを実証すること。

提案手法

  • ラベルなしのプロフェッショナル品質の写真の大規模データセットを用いて、構図、コントラスト、彩度といった異なる美的側面ごとに別々の深層ニューラルネットワークを訓練する。
  • 各美的側面は、切り出し、HDR調整、ドラマティックマスクといった微分可能で独立して最適化可能な画像操作と関連づけられる。
  • 'ドラマティックマスク' 操作は、既存のフィルターを組み合わせてネガティブ例を生成することで学習され、ペairedデータを必要とせず、高コントラストでドラマチカルな照明効果を強化できるようにする。
  • 仮想のフォトグラファー・エージェントは、Google ストリートビューのパノラマを基盤とするシミュレーテッド環境を用い、フレーミングの選択と順次的な現像処理を実行する。
  • 予測された美的スコア(Φ̄)を用いて画像出力をランク付けし、スコアが高いほどプロの好まれる可能性が高くなる。
  • 盲検評価プロトコルを採用し、プロフェッショナル写真家がロボット生成と人間生成の画像を混在させ、4段階の美的品質レベルで評価するが、出典の情報は与えられない。

実験結果

リサーチクエスチョン

  • RQ1盲検評価環境下で、ディーブラーニングシステムがプロの作品と区別がつかない写真を生成できるか?
  • RQ2ラベル付きの前後画像ペアや明示的な美的ラベルを一切使わず、写真の美的側面を複数独立して学習することは可能か?
  • RQ3'ドラマティックマスク' のような新しい画像処理を、ラベルなしデータからエンドツーエンドに学習し、照明コントラストといった特定の美的品質を向上させることは可能か?
  • RQ4制御された盲検環境下で、専門家の写真家が評価した場合、機械学習システムがどの程度までプロフェッショナルレベルの美的品質に達するか?
  • RQ5予測された美的スコア(Φ̄)は、実際にプロが評価した画像品質とどの程度相関しているか?

主な発見

  • 予測スコアが 2.9 以上のロボット生成写真のうち、約 41.4%が盲検評価で半プロ以上(3.0 以上)の評価を得た。
  • スコアが高く(Φ̄ ≥2.9)、優れた作品群のうち、13%が 3.5 以上の評価を得ており、プロフェッショナル品質の上位に近い水準に達した。
  • 予測スコア Φ̄ はプロの評価と強く相関しており、Φ̄ が高くなるほど平均的なプロのスコアも顕著に上昇した。
  • AVA データセットの上位 5%の画像(プロフェッショナルとみなされる)でさえ、3.5 以上の評価を獲得した割合が 45%にとどまり、アルゴリズム性能の現実的な上限を示唆している。
  • システムはラベルなしデータから 'ドラマティックマスク' 操作を成功裏に学習し、ペアドデータを必要とせず、照明コントラストを向上させた。
  • 手動でのフィルタリングにより、深刻なアーティファクト(例:ぼやけ、ずれ)を含む結果が除外され、最も成功した出力は、公開用のショーケースWebページにまとめられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。