Skip to main content
QUICK REVIEW

[論文レビュー] Multi-level Multimodal Common Semantic Space for Image-Phrase Grounding

Hassan Akbari, Svebor Karaman|arXiv (Cornell University)|Nov 28, 2018
Multimodal Machine Learning Applications参考文献 64被引用数 6
ひとこと要約

本論文は、非線形な深層視覚特徴と文脈を考慮したテキスト埋め込み(例:ELMo)を共有空間にマッピングすることで、画像フレーズアライメントのためのマルチレベルマルチモodal共通意味空間を提案する。コサイン類似度を用いたアライメントが可能となる。マルチレベルアテンション機構により、各クエリごとに最も関連性の高い視覚的意味的レベルを選択し、Flickr30k、COCO、VGの3つのベンチマークでSOTA性能を達成し、相対的向上率20%〜60%を達成した。

ABSTRACT

We address the problem of phrase grounding by lear ing a multi-level common semantic space shared by the textual and visual modalities. We exploit multiple levels of feature maps of a Deep Convolutional Neural Network, as well as contextualized word and sentence embeddings extracted from a character-based language model. Following dedicated non-linear mappings for visual features at each level, word, and sentence embeddings, we obtain multiple instantiations of our common semantic space in which comparisons between any target text and the visual content is performed with cosine similarity. We guide the model by a multi-level multimodal attention mechanism which outputs attended visual features at each level. The best level is chosen to be compared with text content for maximizing the pertinence scores of image-sentence pairs of the ground truth. Experiments conducted on three publicly available datasets show significant performance gains (20%-60% relative) over the state-of-the-art in phrase localization and set a new performance record on those datasets. We provide a detailed ablation study to show the contribution of each element of our approach and release our code on GitHub.

研究の動機と目的

  • 弱い教師信号を用いて、画像内での自然言語フレーズの局所化という課題に取り組む。
  • 固定されたバウンディングボックス提案やグローバル画像特徴に依存する従来手法の限界を克服する。
  • 視覚的およびテキスト的特徴の非線形的でマルチレベルの共通意味空間を学習することで、クロスマodalなアライメントを向上させる。
  • マルチレベルマルチモダルアテンション機構により、各単語ごとの柔軟な視覚的特徴選択を可能にする。
  • バウンディングボックスのアノテーションを必要としない弱教師信号学習フレームワークを用いて、フレーズアライメントベンチマークでSOTA性能を達成する。

提案手法

  • VGGやPNASNetなどの深層畳み込みニューラルネットワーク(CNN)から得られる複数のレベルの特徴マップを用い、マルチスケールの視覚的表現を捉える。
  • 文字ベースの言語モデル(例:ELMo)を用いて、文脈を考慮した単語および文の埋め込みを活用し、より豊かなテキスト表現を実現する。
  • 視覚的特徴とテキスト埋め込みを共有の共通意味空間に変換するための専用の非線形マッピングを適用する。
  • 各視覚的およびテキスト的レベルでアテンションヒートマップを計算するマルチレベルマルチモダルアテンション機構を導入する。
  • 共通空間におけるコサイン類似度を用いて、各クエリごとに関連性スコアに基づき最適な視覚的意味的レベルを選択する。
  • バウンディングボックスのアノテーションを必要とせず、画像-文ペアを用いた弱教師信号でモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1単一レベルまたは線形マッピング手法と比較して、マルチレベル共通意味空間はフレーズアライメント性能を向上させるか?
  • RQ2視覚的およびテキスト的特徴に非線形マッピングを適用することで、アライメント精度にどのような影響を与えるか?
  • RQ3文脈を考慮したテキスト埋め込み(例:ELMo)を用いることで、静的または非文脈的埋め込みと比較して、アライメント性能がどの程度向上するか?
  • RQ4各単語やフレーズごとに最適な視覚的意味的レベルを選択するマルチレベルアテンション機構は、局所化の精度を向上させるか?
  • RQ5アテンションヒートマップに対してソフトマックスを適用しないことで、パフォーマンスと柔軟性にどのような影響があるか?

主な発見

  • 本モデルは、Flickr30k、COCO、Visual Genomeで新たなSOTA性能を達成し、従来手法と比較して相対的向上率20%〜60%を記録した。
  • アブレーションスタディの結果、視覚的およびテキスト的特徴の両方における非線形マッピングが不可欠であることが示され、線形マッピングに置き換えると性能が著しく低下した。
  • 文脈を考慮したテキスト埋め込み(例:ELMo)を用いることで、単語埋め込みの上にBiLSTMを訓練する手法と比較して、顕著なパフォーマンス向上が得られた。
  • アテンションヒートマップにソフトマックスを適用すると性能が劣化し、これは柔軟な特徴選択を制限する強制的な分布を導入するためである。
  • レベル選択機能を備えたマルチレベルアテンション機構は、固定レイヤーベースラインを著しく上回り、動的レベル選択の価値を示した。
  • 本モデルは、複雑またはレアなフレーズ(例:'bronco')の局所化に成功し、困難な状況でも一般化できるが、意味的に類似した領域や過露出領域では偶発的に失敗することがある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。