Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Image Cropping for Visual Aesthetic Enhancement Using Deep Neural Networks and Cascaded Regression

Guanjun Guo, Hanzi Wang|arXiv (Cornell University)|Dec 25, 2017
Visual Attention and Saliency Detection参考文献 31被引用数 6
ひとこと要約

本稿では、視覚的美的な質を向上させるために、深層畳み込みニューラルネットワーク(CNN)特徴量と勾配ブースティングを用いたランダム・フェアンス回帰器を活用した、段階的クロッピング回帰(CCR)手法を提案する。2段階の学習戦略(まず大規模な美的データセットでCNNを訓練し、その後CNN特徴量からクロッピングボックスを回帰する)を採用することで、最先端の手法を上回る性能を達成し、4.3–6.3%の失敗率と1枚あたり1.7秒の推論時間を実現した。

ABSTRACT

Despite recent progress, computational visual aesthetic is still challenging. Image cropping, which refers to the removal of unwanted scene areas, is an important step to improve the aesthetic quality of an image. However, it is challenging to evaluate whether cropping leads to aesthetically pleasing results because the assessment is typically subjective. In this paper, we propose a novel cascaded cropping regression (CCR) method to perform image cropping by learning the knowledge from professional photographers. The proposed CCR method improves the convergence speed of the cascaded method, which directly uses random-ferns regressors. In addition, a two-step learning strategy is proposed and used in the CCR method to address the problem of lacking labelled cropping data. Specifically, a deep convolutional neural network (CNN) classifier is first trained on large-scale visual aesthetic datasets. The deep CNN model is then designed to extract features from several image cropping datasets, upon which the cropping bounding boxes are predicted by the proposed CCR method. Experimental results on public image cropping datasets demonstrate that the proposed method significantly outperforms several state-of-the-art image cropping methods.

研究の動機と目的

  • 美的品質は主観的であり、定量的に測定することが難しいため、視覚的美的な質の向上を目的とした自動画像クロッピングの課題に対処する。
  • クロッピングデータの不足を補うために、大規模な弱教師あり美的データセットを活用し、クロッピング回帰の前段階としてCNNを事前学習する。
  • 勾配ブースティングを用いたランダム・フェアンスをプリミティブな回帰器として採用することで、段階的回帰の収束速度と精度を向上させる。
  • まず事前学習済みCNNで判別的な特徴量を抽出し、その後最適なクロッピング領域を回帰する2段階の学習パイプラインを構築する。
  • 限定的なボクシングボックスの監督情報のもとでも、プロの写真家によるアノテーションと密接に一致する高品質なクロッピング結果を達成する。

提案手法

  • 大規模な美的データセット(AVA)で深層畳み込みニューラルネットワーク(CNN)分類器を訓練し、判別的な画像表現を学習する。
  • 事前学習済みCNNを用いて画像クロップからCNN特徴量を抽出し、これをクロッピング回帰タスクの入力として使用する。
  • 各段階で弱いランダム・フェアンス回帰器のグループを用いた段階的回帰フレームワークを実装し、勾配ブースティングにより改善することで収束性を向上させる。
  • 2段階の学習戦略を採用:まず画像レベルの美的ラベルでCNNを事前学習し、その後写真家によるボクシングボックスアノテーションを用いて回帰ヘッドをファインチューニングする。
  • 複数段階の回帰ステージを繰り返し、ボクシングボックス予測を段階的に改善することで、最適なクロッピング領域を予測する訓練済みCCRモデルを適用する。
  • CNNの高レベルな意味的特徴量を活用して、美的に魅力的な領域の局所化をガイドすることで、回帰プロセスを最適化する。

実験結果

リサーチクエスチョン

  • RQ1弱教師あり美的データと限定的ボクシングボックスクロッピングアノテーションの間を埋めるために、2段階の学習戦略が有効に機能するか?
  • RQ2勾配ブースティングを用いたランダム・フェアンスを用いた段階的回帰は、通常のランダム・フェアンスを用いた段階的回帰と比較して、収束性と精度をどのように向上させるか?
  • RQ3事前学習済みの美的分類器から抽出したCNN特徴量は、自動画像クロッピングの性能をどの程度向上させるか?
  • RQ4公開クロッピングデータセットにおいて、提案手法はIoUおよびBDE指標の面で最先端手法と比較してどのように差をつけるか?
  • RQ5どのような画像が本手法にとって最も困難であり、どのような失敗パターンが生じるか?

主な発見

  • 提案手法CCRは、3つの公開画像クロッピングデータセットにおいて、4つの最先端手法を上回るIoUおよびBDE指標を達成した。
  • 3つのテストデータセットにおいて、失敗率がわずか4.3–6.3%にとどまり、プロの写真家による品質基準に近いクロッピング領域を予測する信頼性の高さを示した。
  • 1枚あたりの平均推論時間は1.7秒であり、競合する改善済み変化ベース手法の11秒と比較して顕著に高速であった。
  • アテンションベース手法は、局所的な注目領域に焦点を当てすぎたが、全体の美的構図を無視したため、最も成績が悪かった。
  • 美的ベース手法は、局所的な高品質領域を優先し、全体の構図を無視したが、CCR手法はプロのクロッピングパターンから学習したため、この点で優位であった。
  • 失敗事例の主な原因は、物体が画像境界付近にある(部分的クロッピングのリスク)こと、および背景が均一で模様のない場合であり、エッジや構造のモデリングに限界があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。