Skip to main content
QUICK REVIEW

[论文解读] Prefix-diffusion: A Lightweight Diffusion Model for Diverse Image Captioning

Guisheng Liu, Yi Li|arXiv (Cornell University)|Sep 10, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用 3
一句话总结

Prefix-diffusion 提出了一种轻量级的、基于扩散模型的图像字幕生成方法,通过在去噪过程中注入连续的前缀图像嵌入,生成多样、流畅且相关的字幕。通过利用冻结的 CLIP 编码器和一个小型可训练映射网络,其参数量相比基于 CLIP 的基线模型减少了 38% 以上,同时在 Dist-3 和词汇使用率等新指标上达到了最先进性能。

ABSTRACT

While impressive performance has been achieved in image captioning, the limited diversity of the generated captions and the large parameter scale remain major barriers to the real-word application of these systems. In this work, we propose a lightweight image captioning network in combination with continuous diffusion, called Prefix-diffusion. To achieve diversity, we design an efficient method that injects prefix image embeddings into the denoising process of the diffusion model. In order to reduce trainable parameters, we employ a pre-trained model to extract image features and further design an extra mapping network. Prefix-diffusion is able to generate diverse captions with relatively less parameters, while maintaining the fluency and relevance of the captions benefiting from the generative capabilities of the diffusion model. Our work paves the way for scaling up diffusion models for image captioning, and achieves promising performance compared with recent approaches.

研究动机与目标

  • 解决自回归图像字幕模型中生成重复或通用字幕导致的多样性不足问题。
  • 减少多模态字幕模型中通常庞大的参数量,提升实际部署的可行性。
  • 实现并行的、非自回归的字幕生成,避免自回归自左向右解码带来的错误累积。
  • 通过弥合视觉-语言模态之间的差距,有效将连续扩散模型整合到图像字幕生成中。
  • 在跨领域任务中实现强泛化能力,包括零样本跨数据集评估。

提出的方法

  • 将学习得到的前缀图像嵌入注入连续扩散模型的去噪过程中,以视觉内容为条件进行文本生成。
  • 使用预训练的 CLIP 图像编码器作为冻结的特征提取器,以减少可训练参数量。
  • 采用轻量级、可训练的映射网络,将 CLIP 图像特征映射到文本空间,用于扩散建模。
  • 在前向扩散过程中应用截断线性噪声调度,以保持语义完整性并提升生成质量。
  • 通过在推理阶段从多个噪声种子采样生成多样字幕,避免束搜索的局限性。
  • 利用基于 CLIP 的图文相似度选择最优候选字幕,实现相关性与多样性的平衡。

实验结果

研究问题

  • RQ1连续扩散模型能否在保持流畅性和相关性的同时,有效适配于多样化的图像字幕生成?
  • RQ2如何在不牺牲性能的前提下,提升视觉-语言字幕生成中的参数效率?
  • RQ3在扩散去噪过程中注入视觉前缀是否能提升字幕的多样性和质量?
  • RQ4该模型在跨领域任务中表现如何,特别是在零样本跨数据集评估中?
  • RQ5不同的噪声调度对字幕质量和语义保留有何影响?

主要发现

  • Prefix-diffusion 在 Dist-3 指标上达到 109.3,在词汇使用率上达到 107.8,分别较基线模型提升 6.3 和 3.1。
  • 与现有基于 CLIP 的方法相比,该模型将可训练参数量减少了 38% 以上,同时在 CIDEr、BLEU 和 ROUGE-L 指标上保持或提升了性能。
  • 在跨数据集评估中,Prefix-diffusion 在 COCO → Flickr30k 设置下优于所有基线模型,且在大规模数据集上预训练时展现出更强的泛化能力。
  • 截断线性噪声调度表现更优,相比余弦或标准调度,显著提升了字幕质量和描述准确性。
  • 消融实验表明,使用 CLIP 相似度选择 top-k 字幕可使 CIDEr 从 105.2 提升至 109.3,但候选数量过多可能降低流畅性。
  • 该模型能生成表达丰富、句式多样的字幕,与人类生成的字幕相比更具匹配度,优于自回归模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。