Skip to main content
QUICK REVIEW

[論文レビュー] More Grounded Image Captioning by Distilling Image-Text Matching Model

Yuanen Zhou, Meng Wang|arXiv (Cornell University)|Apr 1, 2020
Multimodal Machine Learning Applications参考文献 70被引用数 12
ひとこと要約

本稿では、高価な語領域対応アノテーションを必要とせずに、視覚的注意の位置特定を向上させるために、品詞を強化した画像・テキストマッチングモデルであるPOS-SCANを提案する。SCANを弱教師モデルとして用い、品詞タギングにより名詞でない語をフィルタリングすることで、注意の位置特定精度を著しく向上させつつ、キャプション生成の品質を維持または向上させた。Flickr30k EntitiesおよびMS-COCOベンチマークで最先端の結果を達成した。

ABSTRACT

Visual attention not only improves the performance of image captioners, but also serves as a visual interpretation to qualitatively measure the caption rationality and model transparency. Specifically, we expect that a captioner can fix its attentive gaze on the correct objects while generating the corresponding words. This ability is also known as grounded image captioning. However, the grounding accuracy of existing captioners is far from satisfactory. To improve the grounding accuracy while retaining the captioning quality, it is expensive to collect the word-region alignment as strong supervision. To this end, we propose a Part-of-Speech (POS) enhanced image-text matching model (SCAN \cite{lee2018stacked}): POS-SCAN, as the effective knowledge distillation for more grounded image captioning. The benefits are two-fold: 1) given a sentence and an image, POS-SCAN can ground the objects more accurately than SCAN; 2) POS-SCAN serves as a word-region alignment regularization for the captioner's visual attention module. By showing benchmark experimental results, we demonstrate that conventional image captioners equipped with POS-SCAN can significantly improve the grounding accuracy without strong supervision. Last but not the least, we explore the indispensable Self-Critical Sequence Training (SCST) \cite{Rennie_2017_CVPR} in the context of grounded image captioning and show that the image-text matching score can serve as a reward for more grounded captioning \footnote{https://github.com/YuanEZhou/Grounded-Image-Captioning}.

研究の動機と目的

  • 高価な語領域対応アノテーションに依存せずに、画像キャプション生成モデルにおける視覚的注意の位置特定を向上させること。
  • より良い注意の局所化を通じて、ニューラル画像キャプションモデルの解釈可能性と透明性を高めること。
  • 画像・テキストマッチングモデルが、キャプションにおける位置特定のための有効な弱教師として機能できるかを検討すること。
  • マッチングスコアを強化学習の報酬として用いることで、キャプション品質と位置特定性能のトレードオフを調査すること。

提案手法

  • 品詞タガーを用いて名詞でない語をフィルタリングすることで、位置特定精度を向上させるために変更されたSCAN画像・テキストマッチングモデルであるPOS-SCANを提案する。
  • POS-SCANモデルを教師として、キャプションモデル(例:Up-Down)の視覚的注意モジュールに知識蒸留するための注意蒸留損失を用いる。
  • 学生キャプションモデルと教師POS-SCANモデルの間の注意マップの差異を最小化することで、知識蒸留を実施する。
  • 画像・テキストマッチングスコア(SCANまたはPOS-SCAN)を自己強化学習によるシーケンス訓練(SCST)の報酬関数として統合し、位置特定を最適化する。
  • 2段階の訓練を採用:交差エントロピー損失による事前学習の後、マッチングスコアを報酬として用いたSCSTによるファインチューニング。
  • ボトムアップ視覚特徴と標準的な評価指標(BLEU、METEOR、CIDEr、SPICE)に加え、注意精度を評価に組み込む。

実験結果

リサーチクエスチョン

  • RQ1弱教師付きの画像・テキストマッチングモデルは、語領域アノテーションなしで、画像キャプション生成モデルにおける視覚的注意の位置特定を向上させることができるか?
  • RQ2マッチングスコア内で名詞でない語をフィルタリングすることで、画像・テキストマッチングモデルの位置特定性能が向上するか?
  • RQ3画像・テキストマッチングスコアは、SCSTにおける有効な報酬として機能できるか?
  • RQ4異なるマッチングスコアを報酬として用いる場合、キャプション品質と位置特定性能の間にトレードオフが生じるか?

主な発見

  • POS-SCANはFlickr30k Entitiesで19.83%の注意精度を達成し、元のSCAN(17.63%)を上回り、Up-Downキャプショナーと同等の性能を示した。これは、強力な教師信号なしに位置特定性能が向上したことを示している。
  • POS-SCANを報酬として用いたファインチューニングにより、Flickr30k Entitiesで17.49%のF1_locを達成し、CIDErのみを報酬として用いたモデルを著しく上回った。
  • 提案手法は、ベースラインモデルと比較してSPICEスコアを1.5ポイント(66.2から69.3に)、F1_locを1.7ポイント(15.79から17.49に)向上させたが、真の注意マップのアノテーションは一切使用していない。
  • MS-COCO Karpathyテストセットでは、80.2 B@1、38.0 B@4、28.5 Mのスコアを達成し、F1_locは22.2であった。これは、全指標で優れた性能を示している。
  • SCSTにおける報酬としてSCANを使用すると、CIDErのみを報酬として用いた場合に比べ、位置特定性能が向上した。POS-SCANは、キャプション品質と位置特定性能の両立をより良く実現した。
  • 定性的な結果から、本手法はより正確な注意マップを生成し、"men" や "shirt" といった語を対応する画像領域に正しく対応づけていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。