Skip to main content
QUICK REVIEW

[論文レビュー] VIVO: Visual Vocabulary Pre-Training for Novel Object Captioning

Xiaowei Hu, Xi Yin|arXiv (Cornell University)|Sep 28, 2020
Multimodal Machine Learning Applications参考文献 53被引用数 16
ひとこと要約

この論文では、画像-タグペアから画像キャプションの教師なしデータを必要とせず、ハンガリアンマッチング損失を用いたマスキングタグ予測タスクにより、クロスモodal表現を学習する視覚的語彙の事前学習手法VIVOを提案する。大規模な画像-タグデータでの事前学習により、画像キャプションにおける未知のオブジェクトへのゼロショット一般化がSOTA水準に達し、CIDErスコア77.8でnocapsベンチマークで人間の性能を上回る。

ABSTRACT

It is highly desirable yet challenging to generate image captions that can describe novel objects which are unseen in caption-labeled training data, a capability that is evaluated in the novel object captioning challenge (nocaps). In this challenge, no additional image-caption training data, other thanCOCO Captions, is allowed for model training. Thus, conventional Vision-Language Pre-training (VLP) methods cannot be applied. This paper presents VIsual VOcabulary pretraining (VIVO) that performs pre-training in the absence of caption annotations. By breaking the dependency of paired image-caption training data in VLP, VIVO can leverage large amounts of paired image-tag data to learn a visual vocabulary. This is done by pre-training a multi-layer Transformer model that learns to align image-level tags with their corresponding image region features. To address the unordered nature of image tags, VIVO uses a Hungarian matching loss with masked tag prediction to conduct pre-training. We validate the effectiveness of VIVO by fine-tuning the pre-trained model for image captioning. In addition, we perform an analysis of the visual-text alignment inferred by our model. The results show that our model can not only generate fluent image captions that describe novel objects, but also identify the locations of these objects. Our single model has achieved new state-of-the-art results on nocaps and surpassed the human CIDEr score.

研究の動機と目的

  • 画像キャプション学習データに存在しない未知のオブジェクトに対してキャプションを生成する課題に対処すること。
  • 従来のビジョン・ランゲージ・プリトレーニング(VLP)がペaired画像-キャプションデータに依存するという制限を克服すること。
  • 大規模で弱教師ありの画像-タグデータを活用して、一般化性能を向上させるための視覚的語彙を事前学習すること。
  • 事前学習済みの視覚的意味的埋め込み空間を通じて、画像キャプションにおける未知の視覚的概念へのゼロショット一般化を可能にすること。
  • nocapsベンチマークでSOTAの性能を達成し、人間のCIDErスコアを上回ること。

提案手法

  • 大規模な画像-タグペア上でマルチレイヤーのトランスフォーマー・モデルを事前学習し、統合された視覚的・言語的埋め込み空間を学習すること。
  • マスキングタグ予測を事前学習の目的関数として用い、1つ以上のタグをマスキングし、画像領域特徴とマスキングされていないタグに基づいて予測すること。
  • 画像タグの順序に依存しない性質を考慮し、予測タグと正例タグの正しい対応付けを保証するため、ハンガリアンマッチング損失を適用すること。
  • 「person」と「man」のような意味的に類似したオブジェクトを、視覚的語彙空間内で近いベクトル表現へマップするようにモデルを学習すること。
  • COCOの画像-キャプションペアで事前学習モデルを微調整し、自然で根拠のあるキャプションを生成すること。
  • 推論に1つのモデルを用いることで、微調整時に学習されていない新しいオブジェクトのゼロショットキャプションを可能にすること。

実験結果

リサーチクエスチョン

  • RQ1画像-キャプションのアノテーションを一切使用せずに、画像-タグペアから視覚的語彙を効果的に学習できるか?
  • RQ2大規模な画像-タグデータでの事前学習が、画像キャプションにおける未知オブジェクトへのゼロショット一般化を向上させるか?
  • RQ3マスキングタグ予測と組み合わせたハンガリアンマッチング損失は、順序のない視覚的・言語的対応付けを学習するためにどれほど有効か?
  • RQ4弱教師ありの画像-タグデータで事前学習したモデルが、nocapsベンチマークで既存手法を上回るか?
  • RQ5視覚的語彙のサイズ(タグクラス数)が、下流のキャプション生成性能に与える影響はどの程度か?

主な発見

  • VIVOの事前学習は、nocapsベンチマークにおける画像キャプション性能を顕著に向上させ、CIDErスコア77.8を達成し、人間のCIDErスコアを上回った。
  • 事前学習に6.4Kのタグクラスを使用した場合、事前学習なしのベースラインに比べてCIDErスコアが6.9%向上し、より大きな視覚的語彙の利点を示した。
  • マスキングタグ予測にハンガリアンマッチング損失を適用した場合、単一トークンマスキングやハンガリアンマッチングなしの手法よりも優れており、CIDErスコアが2.9ポイント向上した。
  • モデルは強力なゼロショット一般化を達成し、微調整時に学習されていない画像においても「accordion」のような未知のオブジェクトを正確に記述できた。
  • 事前学習段階で学習された視覚的語彙は、意味的に類似したオブジェクトを近いベクトル表現へマップしており、構成的一般化を可能にした。
  • COCO(視覚的コンセプトが限定的)で微調整されたとしても、VIVOで事前学習されたモデルは、多様でオープンボキャブラリーなnocapsテストセットに対して効果的に一般化できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。