Skip to main content
QUICK REVIEW

[论文解读] Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation

Wenliang Dai, Lu Hou|arXiv (Cornell University)|Mar 12, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出视觉-语言知识蒸馏(VLKD),一种数据与计算高效的方法,通过将预训练的BART语言模型知识蒸馏到CLIP的视觉-文本空间中,使CLIP具备多模态生成能力。该方法在无需微调的情况下实现了SOTA零样本性能——在VQAv2上达到44.5%的准确率,在COCO图像字幕任务上达到84.6的CIDEr分数,同时保持了BART原始的语言理解与生成能力。

ABSTRACT

The recent large-scale vision-language pre-training (VLP) of dual-stream architectures (e.g., CLIP) with a tremendous amount of image-text pair data, has shown its superiority on various multimodal alignment tasks. Despite its success, the resulting models are not capable of multimodal generative tasks due to the weak text encoder. To tackle this problem, we propose to augment the dual-stream VLP model with a textual pre-trained language model (PLM) via vision-language knowledge distillation (VLKD), enabling the capability for multimodal generation. VLKD is pretty data- and computation-efficient compared to the pre-training from scratch. Experimental results show that the resulting model has strong zero-shot performance on multimodal generation tasks, such as open-ended visual question answering and image captioning. For example, it achieves 44.5% zero-shot accuracy on the VQAv2 dataset, surpassing the previous state-of-the-art zero-shot model with $7 imes$ fewer parameters. Furthermore, the original textual language understanding and generation ability of the PLM is maintained after VLKD, which makes our model versatile for both multimodal and unimodal tasks.

研究动机与目标

  • 解决双流VLP模型(如CLIP)因文本编码器能力较弱而缺乏生成能力的局限性。
  • 使CLIP能够在不进行微调的情况下执行零样本多模态生成任务,如视觉问答和图像字幕生成。
  • 在蒸馏后保持预训练语言模型(BART)原有的语言理解与生成性能。
  • 开发一种相比从零开始预训练更节省数据与计算资源的方法。
  • 证明知识蒸馏能够有效将多模态理解能力从CLIP迁移至强大的预训练语言模型(PLM),同时保持单模态能力。

提出的方法

  • 冻结CLIP的视觉与文本编码器,以在蒸馏过程中保留其预训练的多模态表征。
  • 通过对比学习将BART编码器与CLIP的联合多模态嵌入空间对齐,以实现多模态理解。
  • 应用图像条件化的语言建模损失,将BART的编码器与解码器耦合,用于生成任务。
  • 使用可变长度掩码的掩码语言建模目标,训练模型从视觉输入生成连贯的字幕。
  • 使用少量图像-文本对(如100万或300万对)进行知识蒸馏,以降低计算成本。
  • 在推理阶段丢弃CLIP原始文本编码器,改用蒸馏后的BART处理多模态与单模态任务。

实验结果

研究问题

  • RQ1知识蒸馏是否能有效在不微调的情况下将多模态生成能力迁移至CLIP?
  • RQ2蒸馏后模型在多模态生成基准上的性能与SOTA零样本模型相比如何?
  • RQ3BART原始的语言理解与生成能力在蒸馏后保留程度如何?
  • RQ4不同蒸馏目标(如TTDM、ITCL)对模型性能有何影响?
  • RQ5该方法对蒸馏数据集规模与掩码token数量的敏感性如何?

主要发现

  • VLKD模型在VQAv2数据集上实现44.5%的零样本准确率,显著超越此前SOTA零样本模型,且参数量减少7倍。
  • 在COCO图像字幕基准上,模型在零样本评估中达到84.6的CIDEr分数,表明其无需微调即具备强大的生成能力。
  • 在GLUE基准上,模型性能与原始BART几乎完全一致,表明自然语言理解能力几乎未退化。
  • 消融实验证明,TTDM与ITCL蒸馏目标均至关重要,若同时移除两者,VQAv2准确率下降14.5个百分点,CIDEr下降13.5个百分点。
  • 当蒸馏数据集缩减至10万样本时,性能急剧下降,表明充足的数据对有效知识迁移至关重要。
  • 在蒸馏过程中解冻CLIP权重会导致性能显著下降(VQAv2准确率降至31.7%),证实冻结策略能有效保留预训练的多模态空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。