Skip to main content
QUICK REVIEW

[論文レビュー] Consensus Graph Representation Learning for Better Grounded Image Captioning

Wenqiao Zhang, Haochen Shi|arXiv (Cornell University)|Dec 1, 2021
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本稿では、視覚的および言語的シーングラフを生成的対抗構造ネットワークを用いて一致させることで意味的整合性を向上させる、画像キャプション生成のための新規フレームワークであるConsensus Graph Representation Learning (CGRL) を提案する。一貫性のある表現を活用することで、Flickr30k Entities データセットにおいてオブジェクトの幻覚を9%削減し、キャプション生成性能(Cider +2.9)およびグラウンドイング性能(F1 LOC +2.3)を向上させる。

ABSTRACT

The contemporary visual captioning models frequently hallucinate objects that are not actually in a scene, due to the visual misclassification or over-reliance on priors that resulting in the semantic inconsistency between the visual information and the target lexical words. The most common way is to encourage the captioning model to dynamically link generated object words or phrases to appropriate regions of the image, i.e., the grounded image captioning (GIC). However, GIC utilizes an auxiliary task (grounding objects) that has not solved the key issue of object hallucination, i.e., the semantic inconsistency. In this paper, we take a novel perspective on the issue above - exploiting the semantic coherency between the visual and language modalities. Specifically, we propose the Consensus Rraph Representation Learning framework (CGRL) for GIC that incorporates a consensus representation into the grounded captioning pipeline. The consensus is learned by aligning the visual graph (e.g., scene graph) to the language graph that consider both the nodes and edges in a graph. With the aligned consensus, the captioning model can capture both the correct linguistic characteristics and visual relevance, and then grounding appropriate image regions further. We validate the effectiveness of our model, with a significant decline in object hallucination (-9% CHAIRi) on the Flickr30k Entities dataset. Besides, our CGRL also evaluated by several automatic metrics and human evaluation, the results indicate that the proposed approach can simultaneously improve the performance of image captioning (+2.9 Cider) and grounding (+2.3 F1LOC).

研究の動機と目的

  • 視覚と言語のモダリティ間の意味的不整合が原因で生じる、オブジェクトおよび属性の幻覚という、長年の問題に取り組む。
  • 領域グラウンドイングに依存する既存のグラウンドイング画像キャプション(GIC)手法では、属性および関係性の幻覚を是正できないという限界を克服する。
  • 整合化された視覚的および言語的シーングラフから一貫性のある表現を学習することで、不完全または不一致な情報に対しても人間のような推論を模倣した、マルチモーダル推論を向上させる。
  • 一貫性のある知識をキャプション生成および領域注視メカニズムに統合することで、キャプションの質およびグラウンドイングの正確性を両方向上させる。
  • 一貫性に基づく推論が、ベースラインのGIC手法に比べて、より意味的に整合的で正確かつ詳細な画像記述を生成できることを示す。

提案手法

  • 学習中に画像から視覚的シーングラフ($\mathcal{SG}^{\mathcal{V}}$)を構築し、正解キャプションから言語的シーングラフ($\mathcal{SG}^{\mathcal{L}}$)を構築する。
  • グラフ畳み込みネットワーク(GCN)を用いて、視覚的および言語的グラフの3段階の統一されたレベルでノード(オブジェクト、属性、関係)を符号化する。
  • 生成的対抗構造ネットワーク(GASN)を実装し、モダリティ間のノードおよびエッジを一致させることで、符号化された視覚的および言語的グラフを一致させる。
  • 分布の不一致を最小化することで、視覚と言語の間で意味的整合性を保持する一貫性のある表現 $\tilde{\mathbf{u}}$ を学習する。
  • 一貫性のある注視と領域ベースの視覚的注視を組み合わせた二重注視メカニズムを用いて、一貫性のある表現をキャプションデコーダーに統合する。
  • キャプション生成(例:Cider)およびグラウンドイング(例:F1 LOC)性能を最適化する統合的目的関数を用いて、モデルをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1一貫性のある表現学習は、グラウンドイング画像キャプションにおけるオブジェクトの幻覚をどの程度低減するか?
  • RQ2一貫性のある表現は、既存のGICモデルでしばしば幻覚が生じる属性および関係性のモデリングをどのように改善するか?
  • RQ3一貫性のある推論は、領域グラウンドイングのみに依存する場合を上回り、同時にキャプションの質とグラウンドイングの正確性を向上させることができるか?
  • RQ4GASNを用いた視覚的および言語的シーングラフの一致は、モダリティ間での意味的整合性をどのように向上させるか?
  • RQ5正確でグラウンドイングされたキャプションを生成するにあたり、一貫性知識と生の視覚的または言語的グラフの相対的寄与度はそれぞれどの程度か?

主な発見

  • 提案されたCGRLフレームワークは、Flickr30k Entities データセットにおいて、CHAIR i メトリックでオブジェクトの幻覚を9%削減した。
  • CGRLはベースラインモデルに比べてCiderスコアを+2.9向上させ、顕著に優れたキャプションの質および流暢さを示した。
  • モデルはグラウンドイング性能を+F1 LOC 2.3向上させ、生成された語句が正しい画像領域にリンクされている正確性が向上したことを示した。
  • 人的評価では、CGRLがより正確な記述を生成することが確認され、オブジェクト、関係、属性の再現率(R object, R relationship, Rt attribute)が高得点であった。
  • 一貫性のある推論を有するバージョン(CGRL)は、一貫性推論を除外したバージョン(CGRL w/o CR)を上回り、一貫性推論の重要性を裏付けた。
  • t-SNEの可視化により、一貫性のある表現が視覚的および言語的特徴を共有の埋め込み空間によりよく一致させていることが確認され、意味的整合性の向上を支持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。