Skip to main content
QUICK REVIEW

[論文レビュー] Learning Image Aesthetic Assessment from Object-level Visual Components

Jingwen Hou, Sheng Yang|arXiv (Cornell University)|Apr 4, 2021
Visual Attention and Saliency Detection参考文献 44被引用数 4
ひとこと要約

本稿では、汎用的物体検出器によって検出されたオブジェクトレベルの視覚的要素(OVCs)を通じて美しさをモデル化する、画像美醜評価のための新しい深層学習フレームワーク、IAA-OVCを提案する。個々のOVCおよびそれらの対間の関係性を動的に重みづけるために、オブジェクトレベルおよびグラフ注意力メカニズムを適用することで、美醜評価分布予測のパフォーマンスが向上し、視覚的要素が美醜判断にどのように寄与するかを初めて解釈可能に分析可能となる。これは写真技術的および心理的理論と整合的である。

ABSTRACT

As it is said by Van Gogh, great things are done by a series of small things brought together. Aesthetic experience arises from the aggregation of underlying visual components. However, most existing deep image aesthetic assessment (IAA) methods over-simplify the IAA process by failing to model image aesthetics with clearly-defined visual components as building blocks. As a result, the connection between resulting aesthetic predictions and underlying visual components is mostly invisible and hard to be explicitly controlled, which limits the model in both performance and interpretability. This work aims to model image aesthetics from the level of visual components. Specifically, object-level regions detected by a generic object detector are defined as visual components, namely object-level visual components (OVCs). Then generic features representing OVCs are aggregated for the aesthetic prediction based upon proposed object-level and graph attention mechanisms, which dynamically determines the importance of individual OVCs and relevance between OVC pairs, respectively. Experimental results confirm the superiority of our framework over previous relevant methods in terms of SRCC and PLCC on the aesthetic rating distribution prediction. Besides, quantitative analysis is done towards model interpretation by observing how OVCs contribute to aesthetic predictions, whose results are found to be supported by psychology on aesthetics and photography rules. To the best of our knowledge, this is the first attempt at the interpretation of a deep IAA model.

研究の動機と目的

  • 既存の深層画像美醜評価(IAA)手法における解釈可能性の欠如とコンponentレベルのモデリングの不足に対処すること。
  • 画像全体の特徴からではなく、事前に定義されたオブジェクトレベルの視覚的要素(OVCs)を構成要素として画像美醜をモデル化すること。
  • 個々のOVCの重要性およびそれらの相互関係に基づいて、動的で注意力に基づくOVC特徴の集約を可能にすること。
  • OVCの寄与を美醜予測に関連付けることで、深層IAAモデルの最初の定量的解釈を提供すること。
  • モデルの性能が写真技術的ルール(例:注目対象の一貫性)および心理的理論(例:視覚的整合性)と整合しているかを検証すること。

提案手法

  • オブジェクトレベルの視覚的要素(OVCs)は、汎用的物体検出器(例:Faster R-CNN)からの物体検出として定義され、基本的な視覚的単位を構成する。
  • 各OVCは、その領域から抽出された深層一般的特徴(例:MLSP特徴)によって表現され、モデルの入力となる。
  • オブジェクトレベル注意力に基づく再重み付けモジュールは、各OVCの動的重要度スコアを計算し、被写体検出および注目配分を模倣する。
  • グラフ注意力に基づく集約モジュールは、OVC間のペアワイズ関連スコアを計算し、オブジェクト配置の顕著性をモデル化する。
  • 最終的な美醜表現は、学習された注意力重みを用いてOVC特徴を集約し、その後レグレッションヘッドを介して美醜評価分布予測を行う。
  • 解釈可能性は、OVCの注意力スコアと美醜スコアの相関分析を通じて達成され、訓練およびテストセットの両方で検証される。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトレベルの視覚的要素(OVCs)を用いて画像美醜をモデル化することで、深層IAAモデルのパフォーマンスと解釈可能性が向上するか?
  • RQ2学習されたオブジェクトレベルの注意力スコアは、写真技術における被写体検出および注目対象の一貫性と相関するか?
  • RQ3グラフ注意力を介したOVCペア間の関連性は、心理学における視覚的整合性理論が示唆するように、美醜品質の予測に寄与するか?
  • RQ4学習中に得られた注意力パターンは、未観測のテスト画像に対しても一般化可能であり、学習ルールの堅牢性と一般化能力を示唆するか?
  • RQ5モデルが学習した注意力パターンは、確立された写真技術的ルールおよび美醜認識の心理的原則と整合するか?

主な発見

  • 提案されたIAA-OVCフレームワークはAVAデータセットにおいて優れたパフォーマンスを達成し、美醜評価分布予測のSRCCおよびPLCCの両面で先行手法を上回った。
  • オブジェクトレベルの注意力スコアは被写体の存在と強く相関する:『顔』や『人物』といった被写体に対して高い注意力が注がれるほど、美醜スコアは正の相関を示す一方、『耳』のような非被写体に対しては負の相関を示す。
  • ぼやけた領域に高い注意力が注がれる場合、美醜スコアと強く負の相関を示し、画像歪みが美醜品質を損なうことを確認した。
  • 『目』と『顔』のようなオブジェクトクラスペアのグラフ注意力スコアは、美醜スコアと強く正の相関を示し、顕著なオブジェクト配置が認識される品質を向上させることを示唆している。
  • 注意力パターンと美醜スコアの相関関係は、訓練セットからテストセットへと一貫して保持されており、堅牢で一般化可能な注意力メカニズムであることを示している。
  • モデルの注意力挙動は心理学的理論と整合する:被写体が優先され、顕著なオブジェクトペア(例:顔面特徴)が強調されている。これは視覚的整合性および注目対象の一貫性原理を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。