Skip to main content
QUICK REVIEW

[論文レビュー] Grounding Visual Explanations (Extended Abstract)

Lisa Anne Hendricks, Ronghang Hu|arXiv (Cornell University)|Nov 17, 2017
Multimodal Machine Learning Applications参考文献 7被引用数 3
ひとこと要約

この論文では、個々の属性フレーズを画像および生成された説明の両方に関連付けることで、視覚的説明の質を向上させるフレーズ・クリティックモデルを提案している。画像の関連性を保ちつつ言語の流暢さを維持するため、逆転したフレーズ(例:'赤'を'黒'に変更)をネガティブ例として用いた相対的属性ランク付け損失を用いる。このモデルは、先行研究に比べて、局所化精度(85% 対 79% の画像関連属性)で顕著に優れており、視覚的証拠に基づいたより正確で解釈可能な説明を生成する。

ABSTRACT

Existing models which generate textual explanations enforce task relevance through a discriminative term loss function, but such mechanisms only weakly constrain mentioned object parts to actually be present in the image. In this paper, a new model is proposed for generating explanations by utilizing localized grounding of constituent phrases in generated explanations to ensure image relevance. Specifically, we introduce a phrase-critic model to refine (re-score/re-rank) generated candidate explanations and employ a relative-attribute inspired ranking loss using "flipped" phrases as negative examples for training. At test time, our phrase-critic model takes an image and a candidate explanation as input and outputs a score indicating how well the candidate explanation is grounded in the image.

研究の動機と目的

  • ニューラルネットワークで生成されたテキスト的説明において、入力画像に存在しない属性を記述してしまうという、画像関連性の欠如に対処すること。
  • 分類特徴をもつ説明を生成することと、それらの説明が入力画像に視覚的に根拠づけられることの両立を是する。
  • 言語の流暢さと説明フレーズの視覚的根拠づけの両方を同時に最適化するフレームワークの開発。
  • フレーズの根拠づけを評価する学習済みスコアリング機構を通じて、最も画像関連性の高い説明の自動選択を可能にすること。

提案手法

  • 分類特徴を強調するため、判別的損失を用いてトレーニングされたLSTMベースのモデルにより、候補となる説明の系列が生成される。
  • 各説明は、ルールベースのチャンクャーを用いて属性フレーズ(例:'赤いくちばし'、'黒い顔')に分解される。
  • 事前学習済みの根拠づけモデル(hu2017modeling から)が、画像内の各フレーズを視覚的領域に局所化し、バウンディングボックスと局所化スコアを返す。
  • フレーズ・クリティックモデルは、各(フレーズ、領域、スコア)トリプレットを受け取り、フレーズが画像にどの程度根拠づけられているかを反映する単一の画像関連スコア $ S_r $ を計算する。
  • フレーズ・クリティックは、相対的属性ランク付け損失を用いてトレーニングされ、'反転'されたフレーズ(例:'赤'を'黒'に変更)をネガティブ例として用いることで、識別性能を向上させる。
  • 最終的な説明は、フレーズ・クリティックスコア $ S_r $ と文法的流暢さスコア $ S_f = \log P(w_{0:T}) $ の重み付き組み合わせによりランク付けされ、不自然な文の過剰ランク付けを回避する。

実験結果

リサーチクエスチョン

  • RQ1生成されたテキスト的説明が、言語の流暢さを越えて、入力画像に視覚的に根拠づけられているかどうかを効果的に評価できるモデルは存在するか?
  • RQ2言語的品質や分類的特徴の強度を損なわず、視覚的説明の画像関連性をどのように向上させられるか?
  • RQ3個々のフレーズを画像に根拠づけることで、視覚的説明の全体的な正確性と解釈可能性がどの程度向上するか?
  • RQ4相対的属性比較(例:'赤' 対 '黒')に基づいてトレーニングされたクリティックモデルは、標準的な損失関数に比べて、画像に根拠のない説明をより効果的に特定できるか?

主な発見

  • フレーズ・クリティックモデルは、85% の画像関連属性の記述精度を達成し、ベースラインモデル(79%)に比べ顕著に優れている。
  • モデルは、実際には'黒'であるのに'オレンジ'と記述してしまうような誤った記述を、視覚的根拠づけに依拠して効果的に特定・是正する。
  • 高ランクの説明は、常に最も特徴的かつ視覚的に正確な属性(例:ブルーワーゲルの「白い目」)を記述しており、これは重要な区別特徴である。
  • 文法的スコアリング($ S_f $)の統合により、繰り返し「長い首」と記述するなど、文法的に不自然だが視覚的に妥当な説明が過剰にランク付けされるのを防いでいる。
  • システムが生成する視覚的説明は、小さな領域(例:'白い目')を正確に局所化しており、対応するフレーズと一致する色分けされたバウンディングボックスを示している。
  • フレーズ・クリティックモデルは、両方の説明が画像に存在する属性を記述している場合でも、相対的属性比較を活用することで、正しい説明と誤った説明を効果的に区別している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。