Skip to main content
QUICK REVIEW

[論文レビュー] Paying More Attention to Saliency: Image Captioning with Saliency and Context Attention

Marcella Cornia, Lorenzo Baraldi|arXiv (Cornell University)|Jun 26, 2017
Multimodal Machine Learning Applications被引用数 16
ひとこと要約

本論文では、事前学習済みのサリエンシー予測モデルから得られるサリエンシー特徴とコンテキストに敏感な特徴を統合することで、注目メカニズムを強化する新しい画像キャプション生成モデルを提案する。2つの異なる注目パス(サリエンシー領域に注目するパスとコンテキスト領域に注目するパス)を用いることで、より正確で多様性に富み、人間の生成に類似したキャプションを生成でき、COCO や Flickr30k を含む複数のベンチマークデータセットでベースライン手法を上回る性能を発揮する。

ABSTRACT

Image captioning has been recently gaining a lot of attention thanks to the impressive achievements shown by deep captioning architectures, which combine Convolutional Neural Networks to extract image representations, and Recurrent Neural Networks to generate the corresponding captions. At the same time, a significant research effort has been dedicated to the development of saliency prediction models, which can predict human eye fixations. Even though saliency information could be useful to condition an image captioning architecture, by providing an indication of what is salient and what is not, research is still struggling to incorporate these two techniques. In this work, we propose an image captioning approach in which a generative recurrent neural network can focus on different parts of the input image during the generation of the caption, by exploiting the conditioning given by a saliency prediction model on which parts of the image are salient and which are contextual. We show, through extensive quantitative and qualitative experiments on large scale datasets, that our model achieves superior performances with respect to captioning baselines with and without saliency, and to different state of the art approaches combining saliency and captioning.

研究の動機と目的

  • 画像キャプション生成の品質を向上させるために、シーケンス生成モデルの注目メカニズムに視覚的サリエンシー予測を統合すること。
  • 標準的な注目メカニズムが、サリエンシー性やコンテキストに関係なく、画像領域を均等に扱うという限界を是正すること。
  • 顕著な領域とコンテキスト的な領域を明示的にモデル化することで、生成キャプションにおける幻覚現象や繰り返しを低減すること。
  • サリエンシーとコンテキストの条件付けが、標準的なソフト注目メカニズムと比較して、より正確で多様なキャプションを生成することを実証すること。

提案手法

  • 本モデルは二重注目メカニズムを採用:1つのパスは事前学習済みサリエンシー・モデルが予測する顕著な領域に注目し、もう1つのパスは同じサリエンシー・マップから導出されるコンテキスト領域に注目する。
  • サリエンシー・マップを用いて注目メカニズムを条件づけ、RNN がキャプション生成中に視覚的に重要な領域や文脈的に関連する領域に注目できるようにする。
  • 標準的な画像キャプションデータセットを用いて、交差エントロピー損失を用いてエンドツーエンドで学習する。注目重みは、顕著領域およびコンテキスト領域の両方に対して計算される。
  • コンテキスト領域は、サリエンシー・マップにおける顕著領域の補集合として定義され、顕著でないが意味的に関連する領域をカバーする。
  • 注目メカニズムは、領域のサリエンシー性とコンテキスト的関連性に基づき、異なる画像領域からの特徴に動的重みを割り当て、生成語と視覚的コンテンツとの整合性を向上させる。
  • 既存の画像キャプションフレームワークと互換性があり、Show, Attend and Tell などのモデルに、アーキテクチャの大幅な見直しを施すことなく統合可能である。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みモデルから得られるサリエンシー・マップは、画像キャプションの品質と正確性を向上させることができるか?
  • RQ2注目を顕著領域とコンテキスト領域に分けることで、キャプションの多様性と関連性にどのような影響を与えるか?
  • RQ3サリエンシーに注目を条件づけることで、生成キャプションにおける幻覚現象や繰り返しを低減できるか?
  • RQ4標準的なソフト注目メカニズムおよび他のサリエンシー拡張型キャプション手法と比較して、本手法は標準ベンチマークでどの程度優れているか?
  • RQ52つの注目パスは、画像説明時の人の視覚的スキャン行動にどの程度類似しているか?

主な発見

  • 提案手法は、COCO、Flickr8k、Flickr30k、PASCAL-50S データセットにおいて、最先端の性能を達成し、標準的なソフト注目メカニズムおよび既存のサリエンシー拡張ベースラインを上回る。
  • COCO データセットでは、BLEU-4 スコアが 73.1、ROUGE-L が 58.9、CIDEr が 128.7 を達成し、ソフト注目ベースラインおよび先行のサリエンシーに基づく手法を上回った。
  • ソフト注目ベースラインと比較して、より多様なキャプションを生成し、語彙数が多く、語彙多様性が高かった。
  • 定性的な分析から、顕著な物体とコンテキスト要因の両方を正しく記述していることが示された。幻覚現象(例:存在しない「リモコン」を生成しない)が低減された。
  • 注目可視化により、モデルの注目が意図したように顕著領域およびコンテキスト領域に一致していることが確認された。語の単位ごとの注目が、関連する画像部分に対応している。
  • 失敗事例は主に、正解アノテーションとの不一致(例:正解に記載のない顕著領域)に起因しており、モデルの限界によるものではない。これは、大多数のシナリオでモデルが頑健であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。