Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Image Aesthetic Assessment via Self-Supervised Feature Learning

Kekai Sheng, Weiming Dong|arXiv (Cornell University)|Nov 26, 2019
Visual Attention and Saliency Detection参考文献 58被引用数 7
ひとこと要約

本論文は、手動でのアノテーションを一切用いずに、美しさに敏感な特徴を学習するための自己教師あり学習フレームワークを提案する。合成画像の操作をプロキシタスクとして用い、劣化の種類とパラメータを特定する学習により、AVAおよびAADBベンチマークでImageNetで事前学習されたモデルと同等の性能を達成し、大規模なラベル付きデータに依存するのを軽減する。

ABSTRACT

Visual aesthetic assessment has been an active research field for decades. Although latest methods have achieved promising performance on benchmark datasets, they typically rely on a large number of manual annotations including both aesthetic labels and related image attributes. In this paper, we revisit the problem of image aesthetic assessment from the self-supervised feature learning perspective. Our motivation is that a suitable feature representation for image aesthetic assessment should be able to distinguish different expert-designed image manipulations, which have close relationships with negative aesthetic effects. To this end, we design two novel pretext tasks to identify the types and parameters of editing operations applied to synthetic instances. The features from our pretext tasks are then adapted for a one-layer linear classifier to evaluate the performance in terms of binary aesthetic classification. We conduct extensive quantitative experiments on three benchmark datasets and demonstrate that our approach can faithfully extract aesthetics-aware features and outperform alternative pretext schemes. Moreover, we achieve comparable results to state-of-the-art supervised methods that use 10 million labels from ImageNet.

研究の動機と目的

  • 画像美しさ評価データセットにおける手動アノテーションの不足とバイアスを解消すること。
  • 美しさ特徴の学習のための教師あり事前学習の代替として、自己教師あり表現学習を検討すること。
  • 画像操作が美しさに与える知覚的影響に基づいたプロキシタスクの設計。
  • エントロピーに基づくパッチ重み付けにより、学習効率と信号品質を向上させること。
  • 自己教師あり特徴が、美しさベンチマークにおいて大規模な教師あり事前学習の特徴と同等またはそれを上回ることを実証すること。

提案手法

  • 2つの新しいプロキシタスクを設計:(1) パッチに適用された画像編集操作の種類を分類すること、(2) その操作のパrameter値を回帰すること。
  • ぼかし、ピクセル化、パッチシャッフル、カメラシェイクなど、画像美しさを劣化させることが知られている専門家設計の画像操作を用いる。
  • 対照的学習の目的関数を用いて、バックボーンネットワーク(例:ResNet-18)をこれらのプロキシタスクで学習させ、転移可能な特徴を学習する。
  • エントロピーに基づく重み付け戦略を適用し、信号が弱いパッチの重みを低下させることで、学習の安定性と効率を向上させる。
  • バイナリ分類のため、実際の美しさラベルを用いて学習済み特徴を微調整する線形分類器を適用する。
  • 人間による美しさスコアのアノテーションを一切使用せず、合成的・弱いラベル付きの画像パッチのみで事前学習を行う。

実験結果

リサーチクエスチョン

  • RQ1画像の劣化操作に基づく自己教師ありプロキシタスクは、人間の美しさ認識に関連する特徴を効果的に学習できるか?
  • RQ2複数の劣化関連プロキシタスクを同時に学習する方法は、単一タスクの事前学習に比べて、下流の美しさ分類精度で優れているか?
  • RQ3エントロピーに基づくパッチ重み付け戦略は、自己教師あり美しさ特徴学習における学習効率とモデル性能をどの程度向上させるか?
  • RQ4人間による美しさラベルを一切使用せずに学習された自己教師あり特徴は、美しさベンチマークでImageNetで事前学習されたモデルと同等の性能を達成できるか?
  • RQ5どの種類の画像操作が美しさに敏感な表現の学習に最も寄与しているか?

主な発見

  • 提案手法は、CUHKPQデータセットで88.5%、AADBで69.2%の精度を達成し、微調整にのみ美しさラベルを使用しているが、ImageNetで事前学習されたモデルと同等の性能を示した。
  • AVAベンチマークでは、線形ヘッドを用いて80.1%の精度を達成し、1000万枚のImageNetラベルを用いた最先端の教師ありモデルと同等の性能を示した。
  • 劣化の種類とパrameterの予測の両方を共同で事前学習すると、単一タスクで学習する場合に比べ0.3–0.7%高い精度を達成し、相乗効果が確認された。
  • 訓練からカメラシェイクやソフト/粗いノイズ効果を除外すると、AVAおよびAADBで最大0.3–0.6%の性能低下が生じ、これらが美しさ認識と強く関連していることを示した。
  • エントロピーに基づく重み付け戦略は、性能を最低0.5%以上向上させるとともに、学習の安定性を高め、特徴学習における望ましくないダイナミクスを防止した。
  • すべての3つのベンチマークにおいて、標準的な自己教師ありベースライン(コンテキスト予測、ジャイガーパズル、カラー化、回転予測)を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。