Skip to main content
QUICK REVIEW

[論文レビュー] Visual Language Modeling on CNN Image Representations

Hiroharu Kato, Tatsuya Harada|arXiv (Cornell University)|Nov 9, 2015
Multimodal Machine Learning Applications参考文献 62被引用数 6
ひとこと要約

この論文では、事前学習済み畳み込みニューラルネットワーク(CNN)のミドルレベル特徴量を用いて再帰的ニューラルネットワーク言語モデル(RNNLM)を訓練する視覚的言語モデリング手法、CNN-VLMを提案する。特徴量の行および列に沿ったシーケンスを「文」とみなすことにより、予測誤差に基づいて不自然さスコアを計算し、眼の注視予測において最先端の性能を達成するとともに、正則化子として用いることで画像再構成品質の向上を実現した。

ABSTRACT

Measuring the naturalness of images is important to generate realistic images or to detect unnatural regions in images. Additionally, a method to measure naturalness can be complementary to Convolutional Neural Network (CNN) based features, which are known to be insensitive to the naturalness of images. However, most probabilistic image models have insufficient capability of modeling the complex and abstract naturalness that we feel because they are built directly on raw image pixels. In this work, we assume that naturalness can be measured by the predictability on high-level features during eye movement. Based on this assumption, we propose a novel method to evaluate the naturalness by building a variant of Recurrent Neural Network Language Models on pre-trained CNN representations. Our method is applied to two tasks, demonstrating that 1) using our method as a regularizer enables us to generate more understandable images from image features than existing approaches, and 2) unnaturalness maps produced by our method achieve state-of-the-art eye fixation prediction performance on two well-studied datasets.

研究の動機と目的

  • 生成画像や改ざん済み画像において、CNN特徴量が画像の自然さに感受性を示さない問題に対処すること。
  • 低レベルのピクセル統計を越えた高レベルで抽象化された自然さを捉える手法を開発すること。
  • 眼の動き中に視覚的特徴の予測可能性を自然さの代理指標として活用すること。
  • 自然さ測定を画像再構成および眼の注視予測タスクに応用すること。
  • CNN特徴量における自然さの教師なしモデリングが、視覚タスクの性能向上に寄与することを示すこと。

提案手法

  • 事前学習済みネットワーク(例:VGGNet)の複数の層でミドルレベルのCNN特徴量を抽出する。
  • 特徴マップの正規化と直交化を施し、安定性と解釈可能性を向上させる。
  • 各行および各列に対して独立に一方向RNNLMを適用し、順序的な予測可能性をモデル化する。
  • 各空間的位置におけるシーケンスの負の対数尤度を不自然さの指標として計算する。
  • 水平および垂直方向のRNNLMからの不自然さスコアを統合し、単一の不自然さマップを生成する。
  • 不自然さマップを画像再構成における正則化子、または眼の注視予測のためのサリエンシー・マップとして利用する。

実験結果

リサーチクエスチョン

  • RQ1眼の動き中に高レベルの視覚的特徴の予測可能性が、画像の自然さの代理として機能するか。
  • RQ2CNN特徴量にRNNベースの言語モデリングを適用することで、ピクセルレベルのモデルに比べて不自然な画像領域をより効果的に検出できるか。
  • RQ3不自然さスコアを特徴量からの画像再構成に組み込むことで、既存の正則化子に比べて再構成品質が向上するか。
  • RQ4CNN-VLMから導出される不自然さマップが、人間の眼の注視パターンを最先端の正確さで予測できるか。
  • RQ5CNN-VLMの性能はCNN層の選択に依存するか。また、どの層が自然さを最も適切に捉えているか。

主な発見

  • MIT1003データセットでは、シャッフルAUCスコアが0.7096を記録し、既存手法を上回る最先端の性能を達成した。CAT2000データセットでも0.6221を記録した。
  • MIT300データセットではシャッフルAUCが0.7096で2位を記録したが、CAT2000では0.6221で1位を獲得した。
  • 正則化子として用いることで、ベースライン手法に比べて解釈性が高く、より現実的な画像が再構成された。
  • 高レベルのCNN特徴量(例:conv5_4、conv5_1)は、低レベル特徴量よりも眼の注視予測における不自然さマップをより良く生成した。
  • 教師なしの性質のおかげで、ラベル付き注視データを必要としないため、ドメイン変化に対して頑健である。
  • 意味的コンテンツが豊富なカテゴリ(例:社会的、コマーシャル、感情表現)で性能が最も高かったことから、高レベルの意味的特徴に敏感であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。