Skip to main content
QUICK REVIEW

[論文レビュー] Semantic-Conditional Diffusion Networks for Image Captioning

Jianjie Luo, Yehao Li|arXiv (Cornell University)|Dec 6, 2022
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本稿では、非自己回帰的画像キャプションフレームワークとして、クロスモodalリtrievalから得られる意味的事前知識を用いて段階的Transformerアーキテクチャ内の拡散プロセスをガイドする、意味的条件付き拡散ネットワーク(SCD-Net)を提案する。ガイド付き自己クリティカルシーケンス学習を統合することで、COCO上での最先端の性能を達成し、自己回帰的でない手法および競合する自己回帰的手法を上回り、CIDErスコア131.7を達成した。

ABSTRACT

Recent advances on text-to-image generation have witnessed the rise of diffusion models which act as powerful generative models. Nevertheless, it is not trivial to exploit such latent variable models to capture the dependency among discrete words and meanwhile pursue complex visual-language alignment in image captioning. In this paper, we break the deeply rooted conventions in learning Transformer-based encoder-decoder, and propose a new diffusion model based paradigm tailored for image captioning, namely Semantic-Conditional Diffusion Networks (SCD-Net). Technically, for each input image, we first search the semantically relevant sentences via cross-modal retrieval model to convey the comprehensive semantic information. The rich semantics are further regarded as semantic prior to trigger the learning of Diffusion Transformer, which produces the output sentence in a diffusion process. In SCD-Net, multiple Diffusion Transformer structures are stacked to progressively strengthen the output sentence with better visional-language alignment and linguistical coherence in a cascaded manner. Furthermore, to stabilize the diffusion process, a new self-critical sequence training strategy is designed to guide the learning of SCD-Net with the knowledge of a standard autoregressive Transformer model. Extensive experiments on COCO dataset demonstrate the promising potential of using diffusion models in the challenging image captioning task. Source code is available at \url{https://github.com/YehLi/xmodaler/tree/master/configs/image_caption/scdnet}.

研究の動機と目的

  • 自己回帰的および非自己回帰的画像キャプションモデルの限界、特に語の繰り返しや省略の問題に対処する。
  • 生成文の品質が低いことから、非自己回帰的モデルに自己クリティカルシーケンストレーニング(SCST)を適用することが難しいという課題を克服する。
  • クロスモダリティリトリーブからの意味的事前知識を組み込むことで、拡散ベースの画像キャプションにおける視覚的・言語的整合性と文の整合性を向上させる。
  • 拡散モデルの並列生成能力を活用しながら、高品質な出力を維持するスケーラブルな非自己回帰的パラダイムを開発する。

提案手法

  • 各入力画像に対して、大規模なキャプションコーパスから意味的に関連する語をクロスモダリティリトリーブモデルを用いて抽出し、意味的事前知識として用いる。
  • これらの意味的事前知識を連続的拡散プロセスに統合し、拡散Transformerの逆方向ノイズ除去ステップを条件づける。
  • 視覚的・言語的整合性を段階的に向上させるために、複数の拡散Transformerを段階的にスタックする。
  • 文単位の報酬を介して事前学習済みの自己回帰的Transformer教師モデルから知識を転送する、ガイド付き自己クリティカルシーケンストレーニング(GSCST)戦略を設計する。
  • GSCSTを用いた交差エントロピー損失と強化学習の組み合わせにより、学習を安定化させ、文の流暢さを向上させる。
  • 各逆方向ステップがノイズからより整合性があり意味的に整合性のとれた文を生成するように、マルコフ連鎖に基づくノイズ除去プロセスを採用する。

実験結果

リサーチクエスチョン

  • RQ1拡散ベースの非自己回帰的フレームワークは、自己回帰的モデルの欠点を回避しつつ、画像キャプションで競争的な性能を達成できるか?
  • RQ2クロスモダリティリトリーブからの意味的事前知識は、拡散ベースのキャプションにおける視覚的・言語的整合性をどのように向上させるか?
  • RQ3ガイド付き自己クリティカルシーケンストレーニングは、非自己回帰的拡散モデルに効果的に適応可能か?文の流暢さを向上させ、繰り返しを減らせるか?
  • RQ4複数の拡散ベースデコーダーを段階的に組み合わせることで、生成キャプションの品質と整合性が向上するか?
  • RQ5同じエンコーダ・デコーダ構造を有する標準的な自己回帰的Transformerを上回る性能を、拡散モデルが達成できるか?

主な発見

  • SCD-Netは、COCO KarpathyテストスプリットでCIDErスコア131.7を達成し、ベースの拡散モデル(114.5)および強力な非自己回帰的ベースラインを上回った。
  • 意味的事前知識(Semantic)の追加により、ベースの拡散モデルからCIDErが114.5から120.8に向上した。
  • ガイド付き自己クリティカルシーケンストレーニング(GSCST)により、CIDErが120.8から131.7に顕著に向上し、B@4、M、R、Sのすべての指標が向上した。
  • 2つの拡散Transformerを段階的にスタックした場合が最良の性能(CIDEr: 131.6)を示し、3つに増やすとわずかな向上しか得られず、2段階以降で収益逓減が見られた。
  • 1つの拡散Transformerに3つのTransformerブロックを用いるのが最適な性能をもたらした。5つ以上のブロックを用いた深層モデルは、過学習やコンテキストモデリングにおけるノイズの影響により、わずかな性能低下を示した。
  • SCD-Netは、同じTransformerエンコーダ・デコーダ構造を用いた競合する自己回帰的モデルを上回り、拡散モデルが画像キャプション分野における可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。