Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Image Captioning

Yang Feng, Lin Ma|arXiv (Cornell University)|Nov 27, 2018
Multimodal Machine Learning Applications参考文献 43被引用数 10
ひとこと要約

本論文は、ペaired画像文のアノテーションが一切ない状態でキャプション生成モデルを訓練する最初の非教師あり画像キャプションフレームワークを提示する。文書コーパスを用いて敵対的文生成を行い、事前学習済み検出器から視覚的コンセプト知識を蒸留し、共有潜在空間における双方向再構成により画像-キャプションの一貫性を強制することで、非ペア設定下でMSCOCOでCIDErスコア54.9という優れたゼロショット性能を達成した。

ABSTRACT

Deep neural networks have achieved great successes on the image captioning task. However, most of the existing models depend heavily on paired image-sentence datasets, which are very expensive to acquire. In this paper, we make the first attempt to train an image captioning model in an unsupervised manner. Instead of relying on manually labeled image-sentence pairs, our proposed model merely requires an image set, a sentence corpus, and an existing visual concept detector. The sentence corpus is used to teach the captioning model how to generate plausible sentences. Meanwhile, the knowledge in the visual concept detector is distilled into the captioning model to guide the model to recognize the visual concepts in an image. In order to further encourage the generated captions to be semantically consistent with the image, the image and caption are projected into a common latent space so that they can reconstruct each other. Given that the existing sentence corpora are mainly designed for linguistic research and are thus with little reference to image contents, we crawl a large-scale image description corpus of two million natural sentences to facilitate the unsupervised image captioning scenario. Experimental results show that our proposed model is able to produce quite promising results without any caption annotations.

研究の動機と目的

  • 画像キャプションモデルの訓練に、高価なペア画像文データセットへの依存を排除すること。
  • 画像セット、文書コーパス、および事前学習済み視覚的コンセプト検出器のみを用いてキャプションモデルを訓練できること。
  • 生成されたキャプションが文法的に妥当で、画像の内容に基づいて意味的に根拠を持つこと、かつマルチモーダルな一貫性を持つこと。
  • 非ペアデータ上で非教師あり事前学習が、競争力のあるキャプション性能をもたらすかどうかを検証すること。
  • 大規模な200万文の画像記述コーパスを収集・公開し、非教師あり学習を支援すること。

提案手法

  • 敵対的訓練を用いて、大規模な文書コーパス上で言語モデルを訓練し、本物の文と区別がつかない文を生成する。
  • 検出された視覚的コンセプト(例:物体)を生成キャプションに含めるよう促す、コンセプト報酬メカニズムを実装する。
  • 画像と文の特徴を共有潜在空間に投影し、双方向再構成(画像→キャプション、キャプション→画像)を可能にする。
  • ペアラベルが存在しない状況でも、視覚的コンセプト検出器を用いて画像内容にキャプション生成を根拠づけるための監督信号を提供する。
  • 敵対的生成、コンセプト報酬、画像-キャプション再構成の3つの目的を統合し、エンドツーエンドで訓練する。
  • 2段階の訓練パイプラインを採用:まず敵対的およびコンセプト報酬を用いてキャプションモデルを事前学習し、その後再構成目的でファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、ペア画像文アノテーションが一切ない状況でも、高品質な画像キャプションを生成できるか?
  • RQ2単一言語の文書コーパスのみを用いて、文法的に妥当な文を生成できるキャプションモデルをどのように訓練できるか?
  • RQ3ペアデータが存在しない状況でも、視覚的コンセプト検出をどの程度活用して、画像内容にキャプション生成を根拠づけられるか?
  • RQ4共有潜在空間における画像-キャプション再構成は、生成キャプションと入力画像の間の意味的一貫性を向上させられるか?
  • RQ5敵対的生成、コンセプト報酬、再構成の組み合わせが、非教師ありキャプションにおいて測定可能な性能向上をもたらすか?

主な発見

  • 提案された非教師ありモデルは、非ペア設定下でMSCOCOのテストスプリットでCIDErスコア54.9を達成し、pivoting [15] などの先行研究を顕著に上回った。
  • コンセプト報酬の導入により、生成キャプション1文あたりの正しく特定された視覚的コンセプトの平均数が、初期化なしの約0.6から約0.8に向上し、画像内容への根拠づけの向上が裏付けられた。
  • 敵対的生成、コンセプト報酬、再構成の3つの目的を併用した完全モデルが最高の性能を示し、CIDErスコア54.9を達成した。これにより、すべてのコンponentの相乗効果が確認された。
  • 各目的を順次追加することでモデル性能が段階的に向上:再構成なしでは49.0、完全再構成では54.9に到達。双方向再構成の有効性が裏付けられた。
  • 人為的アノテーションが一切ない状況でも、モデルは妥当で多様かつ意味的に一貫性のあるキャプションを生成でき、非教師あり画像キャプションの実現可能性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。