Skip to main content
QUICK REVIEW

[論文レビュー] Senti-Attend: Image Captioning using Sentiment and Attention

Omid Mohamad Nezami, Mark Dras|arXiv (Cornell University)|Nov 24, 2018
Multimodal Machine Learning Applications参考文献 31被引用数 10
ひとこと要約

Senti-Attend は、高レベルの感情埋め込みと単語レベルの感情埋め込みを統合したアテンションベースの画像キャプション生成モデルであり、事実的正確性と感情に配慮したキャプションを生成する。ワンホットベクトルに依存するのではなく、実数値の感情表現を学習することで、意味的整合性が向上し、より適切な感情を含む形容詞および形容詞+名詞のペアを生成する。標準評価指標において最先端の手法を上回る性能を発揮する。

ABSTRACT

There has been much recent work on image captioning models that describe the factual aspects of an image. Recently, some models have incorporated non-factual aspects into the captions, such as sentiment or style. However, such models typically have difficulty in balancing the semantic aspects of the image and the non-factual dimensions of the caption; in addition, it can be observed that humans may focus on different aspects of an image depending on the chosen sentiment or style of the caption. To address this, we design an attention-based model to better add sentiment to image captions. The model embeds and learns sentiment with respect to image-caption data, and uses both high-level and word-level sentiment information during the learning process. The model outperforms the state-of-the-art work in image captioning with sentiment using standard evaluation metrics. An analysis of generated captions also shows that our model does this by a better selection of the sentiment-bearing adjectives and adjective-noun pairs.

研究の動機と目的

  • 画像キャプション生成における事実的画像内容と主観的感情のバランスをとる課題に対処すること。
  • ワンホット感情ベクトルの代わりに学習可能な実数値感情埋め込みを用いることで、画像キャプションにおける感情制御を向上させること。
  • 高レベルと単語レベルの両方の感情情報を統合し、より効果的にキャプション生成をガイドすること。
  • 生成過程において画像コンテンツと感情を含むキャプションの意味的整合性を維持すること。
  • 高品質で感情に配慮した画像キャプションを生成する点で、既存の最先端モデルを上回ること。

提案手法

  • モデルは畳み込みニューラルネットワーク(CNN)を用いて視覚的特徴を抽出し、空間的特徴にわたるアテンション機構を備えたLSTMデコーダーでキャプションを生成する。
  • 高レベルの感情埋め込み(全体のキャプションの感情に条件付けられたもの)と、特定の語彙項目に関連付けられた単語レベルの感情埋め込みの2つの感情埋め込み機構を導入する。
  • 高レベルの感情埋め込みは、各デコーディングステップでLSTMに供給され、キャプション全体の感情を条件づける。
  • 単語レベルの感情埋め込みは、特に形容詞や名詞+形容詞のペアの予測に影響を与える。
  • 感情埋め込みはトレーニング中にエンドツーエンドで学習され、画像コンテンツに基づいて感情を適用すべき場所と方法をモデルが自動で発見できる。
  • モデルは正解キャプションとの交差エントロピー損失を用いて学習され、BLEU、ROUGE、CIDErといった標準指標を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1アテンションベースのモデルは、事実的正確性を保ちながら感情に配慮したキャプションを効果的に生成できるか?
  • RQ2ワンホット符号化と比較して、実数値の感情埋め込みを用いることで感情制御が向上するか?
  • RQ3高レベルと単語レベルの感情表現は、より自然で文脈的に適切な感情を含むキャプションを生成するために互いに補完し合うか?
  • RQ4モデルは、画像コンテンツとターゲット感情の両方に整合する感情を含む形容詞や形容詞+名詞のペアをどれだけ適切に選択できるか?
  • RQ5感情を含む画像キャプションを生成する点で、既存の最先端手法に比べてどの程度優れているか?

主な発見

  • Senti-Attend は、BLEU、ROUGE、CIDErを含むすべての標準評価指標において、感情を含む画像キャプション生成の最先端技術を上回っている。
  • モデルは、画像コンテンツに基づいてより意味的に適切な感情を含む形容詞および形容詞+名詞のペア(例:ポジティブな感情には「beautiful」、ネガティブな感情には「ugly」)を生成する。
  • 実数値の感情埋め込みを用いることで、意味的適合性を無視しても感情を強制するワンホット表現と比較して、キャプション品質が顕著に向上する。
  • 定性的分析の結果、Senti-Attend はさまざまな画像に対して感情を適切に操作できており、ポジティブおよびネガティブな感情の両方において一貫性があり文脈的に適切なキャプションを生成している。
  • モデルは、困難なケース(例:通常はポジティブな光景に対してネガティブな記述)に対しても、多様な感情表現を含むキャプションを生成する点で頑健である。
  • 一部のキャプション生成エラーが見られるものの、Senti-Attend は事実的正確性および感情正確性の両面で、Attend などのベースラインモデルを上回る、画像コンテンツと感情の間の強い整合性を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。