[论文解读] Exploring Discrete Diffusion Models for Image Captioning
该论文提出DDCap,一种用于图像字幕生成的离散扩散模型,通过引入长度预测、集中注意力掩码、最佳优先推理和无需图像的训练方式,解决了自回归方法的局限性。在COCO数据集上,DDCap在未进行CIDEr优化的情况下实现了125.1的SOTA CIDEr得分,相较于自回归基线模型在字幕补全任务中提升了+26.8分,展现出强大的泛化能力和整体上下文建模性能。
The image captioning task is typically realized by an auto-regressive method that decodes the text tokens one by one. We present a diffusion-based captioning model, dubbed the name DDCap, to allow more decoding flexibility. Unlike image generation, where the output is continuous and redundant with a fixed length, texts in image captions are categorical and short with varied lengths. Therefore, naively applying the discrete diffusion model to text decoding does not work well, as shown in our experiments. To address the performance gap, we propose several key techniques including best-first inference, concentrated attention mask, text length prediction, and image-free training. On COCO without additional caption pre-training, it achieves a CIDEr score of 117.8, which is +5.0 higher than the auto-regressive baseline with the same architecture in the controlled setting. It also performs +26.8 higher CIDEr score than the auto-regressive baseline (230.3 v.s.203.5) on a caption infilling task. With 4M vision-language pre-training images and the base-sized model, we reach a CIDEr score of 125.1 on COCO, which is competitive to the best well-developed auto-regressive frameworks. The code is available at https://github.com/buxiangzhiren/DDCap.
研究动机与目标
- 探索将离散扩散模型应用于图像字幕生成的可行性,其中文本生成具有类别性、短文本且长度可变。
- 解决离散扩散模型与自回归模型在文本生成(尤其是图像字幕生成)中的性能差距。
- 设计新颖组件,以适配扩散建模在自然语言独特特性(如长度可变性与离散标记空间)方面的需求。
- 通过字幕补全任务评估模型的鲁棒性与灵活性,凸显其在上下文建模与错误容错方面的优势。
提出的方法
- 引入长度预测头以估计字幕中总标记数,实现对可变长度输出的灵活处理。
- 采用集中注意力掩码,在扩散步骤中动态聚焦于信息丰富的标记,抑制对噪声或不相关标记的关注。
- 最佳优先推理在每一步选择性地固定最自信的K个标记,防止后续步骤中噪声导致先前正确标记被破坏。
- 采用无需图像的训练方式,在预训练阶段屏蔽图像条件,以平衡先验知识与图像条件生成。
- 模型在400万张图像-文本对上进行预训练,使用CLIP图像编码器,所有组件在扩散框架中联合优化。
- 推理采用去噪过程,通过迭代方式逐步恢复被掩码的标记,以非自回归、上下文感知的方式逐步优化字幕。
实验结果
研究问题
- RQ1尽管文本具有离散性和长度可变性,离散扩散模型能否有效生成准确且连贯的图像字幕?
- RQ2如长度预测与集中注意力等关键架构组件,在基于文本的扩散模型中如何提升性能?
- RQ3与标准自回归或全去噪方法相比,最佳优先推理是否能减少错误累积?
- RQ4无需图像的预训练在多大程度上增强了模型在不完全依赖图像信号情况下的语义对齐字幕生成能力?
- RQ5扩散模型所具备的非自回归与灵活生成顺序是否能在上下文敏感任务(如字幕补全)中超越自回归模型?
主要发现
- DDCap在400万张预训练图像的COCO数据集上实现了125.1的CIDEr得分,与最先进自回归模型相比具有竞争力。
- 在字幕补全任务中,DDCap相比自回归基线模型提升了+26.8 CIDEr分(230.3 vs. 203.5),展现出更优的上下文建模能力与鲁棒性。
- 在补全任务中,DDCap的CLIP得分为76.4,略高于自回归基线(75.7),表明其语义对齐能力更强。
- 消融实验表明,所提出的各组件——长度预测、集中注意力、最佳优先推理与无需图像训练——均对性能有显著贡献。
- 定性分析显示,DDCap以逻辑顺序(如先对象后关系)生成字幕,表明其具备更好的结构理解能力。
- 尽管性能有所提升,模型偶尔会产生重复词语,可通过后处理或结合更新的长度预测进行重生成加以缓解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。