Skip to main content
QUICK REVIEW

[論文レビュー] An End-to-End Neural Network for Image Cropping by Learning Composition from Aesthetic Photos

Peng Lu, Hao Zhang|arXiv (Cornell University)|Jul 2, 2019
Visual Attention and Saliency Detection被引用数 12
ひとこと要約

本論文は、注目対象オブジェクトと高美醸領域の空間的関係を学習することで、最適なクロッピング領域を直接予測するエンドツーエンドのディーブラーニングフレームワークを提案する。U-Netベースのサリエンシーディテクタ、アンカーリジョン生成レイヤー、および軽量回帰ネットワークを用いることで、IoUおよびBDEで測定される精度(SOTA)と50 fpsの効率性の両面で優れた性能を達成し、反復的な候補評価を排除した。

ABSTRACT

As one of the fundamental techniques for image editing, image cropping discards unrelevant contents and remains the pleasing portions of the image to enhance the overall composition and achieve better visual/aesthetic perception. In this paper, we primarily focus on improving the accuracy of automatic image cropping, and on further exploring its potential in public datasets with high efficiency. From this respect, we propose a deep learning based framework to learn the objects composition from photos with high aesthetic qualities, where an anchor region is detected through a convolutional neural network (CNN) with the Gaussian kernel to maintain the interested objects' integrity. This initial detected anchor area is then fed into a light weighted regression network to obtain the final cropping result. Unlike the conventional methods that multiple candidates are proposed and evaluated iteratively, only a single anchor region is produced in our model, which is mapped to the final output directly. Thus, low computational resources are required for the proposed approach. The experimental results on the public datasets show that both cropping accuracy and efficiency achieve the state-ofthe-art performances.

研究の動機と目的

  • 反復的な候補生成を経ない、エンドツーエンドのニューラルネットワークを構築し、直接高美醸クロッピング領域を予測すること。
  • 注目対象オブジェクトと高美醸品質の領域との関係をモデル化することで、クロッピングの正確性を向上させること。
  • 包括的なスキャンや複数の候補評価を回避することで、計算効率を向上させること。
  • 確率的フレームワークを用いて、画像コンポジションおよび美醸性における深層特徴の解釈可能性を検討すること。
  • 消費者デバイスへのデプロイに適したリアルタイム性能を達成すること。

提案手法

  • 画像内の主要なオブジェクトを強調するため、U字型の畳み込みニューラルネットワーク(U-Net)を用いてサリエンシーマップを生成する。
  • サリエンシーマップの精緻化のため、ソフトバイナリゼーションレイヤーを適用し、注目オブジェクトとバックグラウンドを分離する。
  • ガウス型カーネルを用いてオブジェクトの整合性を保持し、単一の初期アンカーリジョン領域を定義するアンカーリジョン生成レイヤーを導入する。
  • アンカーリジョンからの特徴抽出のため、リージョンオブインタレスト(ROI)プーリングレイヤーを用いる。
  • アンカーリジョン特徴から直接最終的なクロッピング矩形を予測するため、軽量な回帰ネットワークを活用する。
  • 局所化の正確性と美醸性の両方を最適化するため、確率的フレームワークを用いてパイプライン全体をエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1サリエンシーマップからクロッピング領域への単一の直接的回帰パスが、複数段階の候補生成と評価を経る手法を上回るか?
  • RQ2深層ニューラルネットワークは、注目オブジェクトと高美醸画像コンポジションとの間の内蔵的関係をどれほど正確に学習できるか?
  • RQ3反復的な候補評価を排除することで、正確性を損なわず、計算効率がどの程度向上するか?
  • RQ4ガウスカーネルを用いた提案されたアンカーリジョン生成レイヤーは、オブジェクトの整合性をどのように保持し、局所化を改善するか?
  • RQ5多様なデータセットに一般化可能でありながら、客観的指標と主観的ユーザーの好みの両方で高い性能を維持できるか?

主な発見

  • 提案手法は公開データセットで最先端の性能を達成し、FLMSデータセットでは平均IoUが0.78、BDEが0.81を記録した。
  • システムは平均50フレーム/秒の処理速度を達成しており、リアルタイムアプリケーションに適している。
  • 本手法は、[7]で提案されたブルートフォース探索に依存するベースライン手法よりも5倍速い。
  • 主観的ユーザー評価では、2000票中792票を獲得し、AIC、A2-RL、VENを上回る最も美醸的と感じられたクロッピング結果となった。
  • 失敗事例は主にサリエンシーマップが疎な画像(例:FLMS)や、複数の注目オブジェクトが正解と完全に一致しない画像(例:FCD)で発生しており、サリエンシーディテクタとアノテーションの整合性の限界が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。