Skip to main content
QUICK REVIEW

[论文解读] CLIP-Diffusion-LM: Apply Diffusion Model on Image Captioning

Shitong Xu|arXiv (Cornell University)|Oct 10, 2022
Multimodal Machine Learning Applications被引用 7
一句话总结

该论文提出 CLIP-Diffusion-LM,一种非自回归图像字幕生成模型,利用去噪扩散语言模型进行文本生成,并以 CLIP 特征作为条件。在 Flickr30k+Flickr8k 数据集上,其 BLEU-4 得分为 0.2470,推理步数显著少于自回归模型,证明了扩散模型在图像字幕生成中的可行性与高效性。

ABSTRACT

Image captioning task has been extensively researched by previous work. However, limited experiments focus on generating captions based on non-autoregressive text decoder. Inspired by the recent success of the denoising diffusion model on image synthesis tasks, we apply denoising diffusion probabilistic models to text generation in image captioning tasks. We show that our CLIP-Diffusion-LM is capable of generating image captions using significantly fewer inference steps than autoregressive models. On the Flickr8k dataset, the model achieves 0.1876 BLEU-4 score. By training on the combined Flickr8k and Flickr30k dataset, our model achieves 0.2470 BLEU-4 score. Our code is available at https://github.com/xu-shitong/diffusion-image-captioning.

研究动机与目标

  • 探索扩散模型在非自回归文本生成中的应用,以解决自回归模型存在的生成速度慢、无法优化早期 token 等局限性。
  • 研究基于扩散的语言建模在使用预训练 CLIP 和 DistilBERT 组件时,生成高质量图像字幕的有效性。
  • 在基于扩散的字幕生成背景下,实证评估损失加权、指导调度和特征融合方法等设计选择的影响。
  • 提供提升基于扩散的图像字幕生成中字幕质量和模型收敛性的训练技巧见解。

提出的方法

  • 模型使用 CLIP 提取图像和文本特征,通过拼接或逐元素相加的方式与字幕嵌入进行融合。
  • 基于 DistilBERT 训练一个扩散语言模型,通过在每个时间步预测噪声来去噪潜在文本序列,目标是重建原始字幕嵌入。
  • 推理时应用无分类器指导,以在不依赖分类器的情况下提升生成质量。
  • 损失函数包含去噪项 $ L_{diffuseLM} $、重建项 $ L_{recon} $ 和四舍五入项 $ L_{round} $,并采用自适应加权以平衡收敛性与性能。
  • 模型被训练为预测 $ x_0 $,即原始字幕嵌入,而非后续去噪状态,这提升了性能与收敛速度。
  • 对初始学习率、损失加权以及 $ x_0 $-预测与 $ x_{s_t - n} $-预测的超参数消融实验,以识别最优配置。

实验结果

研究问题

  • RQ1基于扩散的语言模型能否在非自回归设置下有效生成图像字幕,实现与自回归模型相当的性能?
  • RQ2损失函数各组成部分,尤其是四舍五入项和自适应加权,如何影响模型收敛性与字幕质量?
  • RQ3$ x_0 $-预测与 $ x_{s_t - n} $-预测对生成质量与训练稳定性有何影响?
  • RQ4在训练稳定性存在权衡的情况下,拼接式特征融合方法与逐元素相加方法中,哪种性能更优?
  • RQ5在无独立分类器的情况下,使用无分类器指导如何影响生成字幕的质量?

主要发现

  • 该模型在合并的 Flickr8k 与 Flickr30k 数据集上取得 0.2470 的 BLEU-4 得分,表现出强劲性能,且推理步数显著少于自回归模型。
  • 与 $ x_{s_t - n} $-预测相比,采用 $ x_0 $-预测可获得更高的 BLEU-4 得分(0.1549 vs. 0.1474)和更低的 $ L_{diffuseLM} $ 损失(17.8 vs. 22.6),表明收敛性与性能均得到改善。
  • 基于拼接的特征融合方法优于逐元素相加,尽管训练损失波动更高,但在合并数据集上实现了 0.2337 的 BLEU-4 得分。
  • 损失函数中添加四舍五入项 $ L_{round} $ 对模型收敛至关重要,且该分量的自适应加权可进一步提升性能。
  • 采用 5e-5 的初始学习率与线性衰减调度时性能最佳,合并数据集训练下 BLEU-4 得分为 0.2470。
  • 模型仅需 5 次扩散推理阶段即可收敛至合理输出,显著优于需与序列长度成比例步数的自回归模型,凸显其高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。