Skip to main content
QUICK REVIEW

[論文レビュー] High-Level Concepts for Affective Understanding of Images

Afsheen Rafaqat Ali, Usman Shahid|arXiv (Cornell University)|May 8, 2017
Image Retrieval and Classification Techniques参考文献 18被引用数 6
ひとこと要約

本論文は、事前学習済み畳み込みニューラルネットワーク(CNN)から抽出された高レベルの概念(HLCs)——例えば物体や場所——を活用して、画像に対する感情反応を予測するハイブリッドモデルを提案する。これにより、低レベル特徴にとどまらず、感情的理解を向上させる。クラス固有の回帰器を用いてHLCsと低レベル特徴を統合することで、離散的 emotions分類(Emotion6で52%の正確度)および次元的感情予測(VAスコア)において最先端の性能を達成するとともに、明示的なHLC-感情関連付けにより解釈可能性を提供する。

ABSTRACT

This paper aims to bridge the affective gap between image content and the emotional response of the viewer it elicits by using High-Level Concepts (HLCs). In contrast to previous work that relied solely on low-level features or used convolutional neural network (CNN) as a black-box, we use HLCs generated by pretrained CNNs in an explicit way to investigate the relations/associations between these HLCs and a (small) set of Ekman's emotional classes. As a proof-of-concept, we first propose a linear admixture model for modeling these relations, and the resulting computational framework allows us to determine the associations between each emotion class and certain HLCs (objects and places). This linear model is further extended to a nonlinear model using support vector regression (SVR) that aims to predict the viewer's emotional response using both low-level image features and HLCs extracted from images. These class-specific regressors are then assembled into a regressor ensemble that provide a flexible and effective predictor for predicting viewer's emotional responses from images. Experimental results have demonstrated that our results are comparable to existing methods, with a clear view of the association between HLCs and emotional classes that is ostensibly missing in most existing work.

研究の動機と目的

  • 画像の内容と人間の感情的反応の間の感情的ギャップを埋めるために、高レベルの概念と感情の間の関連を明示的にモデル化すること。
  • ブラックボックスなCNNや低レベル特徴のみに依存するアプローチの限界を克服すること。
  • HLCsを感情分布にマッピングする透明で解釈可能なフレームワークを構築し、感情計算における説明可能性を向上させること。
  • HLCsと低レベル画像特徴を統合することで、感情的画像分類および感情の価値・覚醒度(VA)予測を改善すること。
  • 人間が理解可能な意味的豊かなHLCsを用いて、感情的画像検索やキャプション生成などの応用を可能にすること。

提案手法

  • ImageNetやPlaces205などの事前学習済みCNNを用いて、画像から高レベルの概念(HLCs)——物体、場所、シーンなど——を抽出する。
  • 最初に、エイカンの6感情(怒り、嫌悪、恐怖、喜び、悲しみ、驚き)と中立をベースラインとして、HLCsと感情クラスの関係を明示的にモデル化するための線形混合モデルを提案する。
  • 感情確率および価値・覚醒度(VA)スコアの予測を可能にするために、サポートベクターレグレッション(SVR)を用いた非線形フレームワークに拡張する。
  • 低レベル特徴(LLFs)とHLCsの組み合わせを用いてクラス固有の回帰器を訓練し、柔軟で頑健な予測を実現するため、ハイブリッド回帰器アンサンブルに統合する。
  • HLC検出と感情予測を分離することで、HLCを画像キャプションなどの代替入力から取得可能にする。
  • 平均真陽性率およびVA予測の絶対平均差(AAD)などの指標を用いて、Emotion6およびArtphotoデータセットでモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1物体や場所などの高レベルの概念(HLCs)を用いて、人間の画像に対する感情的反応を明示的にモデル化・予測できるか?
  • RQ2HLCsは、離散的 emotions分類および次元的感情(価値・覚醒度)予測において、低レベル画像特徴と比較してどのように優れているか?
  • RQ3HLCsと低レベル特徴を組み合わせたハイブリッドモデルは、感情的画像理解分野で既存の最先端手法を上回ることができるか?
  • RQ4異なるHLCソース(例:ImageNet、Places205)が、感情予測性能に与える寄与度は何か?
  • RQ5ブラックボックスなディープラーニングモデルと比較して、HLCsの使用は感情的画像分析における解釈可能性と一般化性能を向上させられるか?

主な発見

  • 提案されたハイブリッドモデルは、Emotion6データセットにおいて、支配的 emotion クラスの予測で52%の正確度を達成し、このデータセットで報告された以前の結果を上回った。
  • 価値・覚醒度(VA)予測においても、最先端の性能を達成し、価値のAADが1.2093、覚醒度のAADが0.6802であった。低レベル特徴のみやCNNで訓練されたモデルよりも優れた性能を示した。
  • 低レベル特徴(LLFs)とPlaces205のHLCsを組み合わせたハイブリッドモデルは、価値のAADが1.2093で最低となり、覚醒度では最高性能を示すベースラインと同等の性能を達成した。
  • HLCsの使用により、特定の概念(例:「墓地」→「恐怖」、「バッタリーや花」→「喜び」)と感情クラスとの明確で解釈可能な関連付けが可能となり、ブラックボックスモデルではしばしば欠落する特徴である。
  • HLC検出の誤りに対してもモデルは頑健であり、事前学習済み分類器の不完全さがあっても、競争的な性能を維持した。
  • HLC抽出と感情予測を分離することで、画像キャプションなどの多様なソースからのHLC統合が可能となり、学習の柔軟性とスケーラビリティが向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。