Skip to main content
QUICK REVIEW

[论文解读] VisualGPT: Data-efficient Adaptation of Pretrained Language Models for Image Captioning

Jun Chen, Han Guo|arXiv (Cornell University)|Feb 20, 2021
Multimodal Machine Learning Applications参考文献 76被引用 14
一句话总结

VisualGPT 提出了一种数据高效的图像字幕生成框架,通过一种新颖的自恢复编码器-解码器注意力机制微调预训练语言模型(PLM)解码器,以平衡视觉和语言输入。在仅使用 MS COCO 的 0.1% 和 Conceptual Captions 的 1% 数据进行训练的情况下,该方法实现了最先进性能,在 MS COCO 上比基线模型最高提升 10.0% 的 CIDEr 分数,在 Conceptual Captions 上提升 17.9%,同时在医学 IU X-ray 数据集上也创下新的 SOTA 成绩。

ABSTRACT

The ability to quickly learn from a small quantity oftraining data widens the range of machine learning applications. In this paper, we propose a data-efficient image captioning model, VisualGPT, which leverages the linguistic knowledge from a large pretrained language model(LM). A crucial challenge is to balance between the use of visual information in the image and prior linguistic knowledge acquired from pretraining. We designed a novel self-resurrecting encoder-decoder attention mechanism to quickly adapt the pretrained LM as the language decoder ona small amount of in-domain training data. The proposed self-resurrecting activation unit produces sparse activations but has reduced susceptibility to zero gradients. We train the proposed model, VisualGPT, on 0.1%, 0.5% and 1% of MSCOCO and Conceptual Captions training data. Under these conditions, we outperform the best baseline model by up to 10.8% CIDEr on MS COCO and upto 5.4% CIDEr on Conceptual Captions. Further, Visual-GPT achieves the state-of-the-art result on IU X-ray, a medical report generation dataset. To the best of our knowledge, this is the first work that improves data efficiency of image captioning by utilizing LM pretrained on unimodal data. Our code is available at: https://github.com/Vision-CAIR/VisualGPT.

研究动机与目标

  • 为解决现实应用中图像字幕标注数据有限的问题,特别是在医学影像等专业领域中的挑战。
  • 通过利用预训练语言模型(PLMs)在不依赖大规模领域内训练数据的情况下,提升图像字幕生成的数据效率。
  • 通过平衡视觉特征与语言先验,弥合单模态 PLM 与多模态图像字幕生成之间的领域差距。
  • 在小样本领域数据微调过程中,减少对预训练语言知识的灾难性遗忘。
  • 利用 PLM 先验降低生成字幕中的对象幻觉,提升事实一致性。

提出的方法

  • VisualGPT 使用预训练语言模型(如 GPT-2)的权重初始化字幕解码器,以保留丰富的语言与语义知识。
  • 提出一种自恢复的编码器-解码器注意力机制,动态平衡来自 CNN 编码器的视觉特征与上下文化的解码器隐藏状态。
  • 自恢复激活单元(SRAU)采用非饱和修正门控函数,生成稀疏激活并防止梯度崩溃,使门控在被置零后仍能恢复。
  • SRAU 机制确保在微调过程中,即使视觉信号微弱或稀疏,PLM 中的先验语言知识也能得以保留。
  • 通过 SRAU 调制的可学习注意力权重,将视觉编码器多层级的视觉特征与解码器状态进行融合。
  • 模型在小规模领域内图像-文本对上进行端到端微调,无需额外预训练或架构重构。

实验结果

研究问题

  • RQ1能否仅使用极小部分领域内训练数据,有效将预训练语言模型适配到图像字幕任务?
  • RQ2在多模态数据微调过程中,如何在不发生灾难性遗忘的前提下,保留 PLM 中的语言知识?
  • RQ3所提出的自恢复注意力机制是否能在低数据场景下改善视觉与语言模态信号之间的平衡?
  • RQ4在低资源设置下,VisualGPT 相较于基线模型,在多大程度上减少了对象幻觉?
  • RQ5该模型能否在极少量数据下泛化到医学报告生成等专业领域?

主要发现

  • 在仅使用 MS COCO 的 0.1% 数据时,VisualGPT 的 CIDEr 分数比最佳基线高出 10.0%,展现出强大的数据效率。
  • 在仅使用 Conceptual Captions 的 1% 数据时,VisualGPT 的 CIDEr 分数比最强基线提升 17.9%,凸显其在低资源场景下的有效性。
  • VisualGPT 在 IU X-ray 医学报告生成数据集上创下新的最先进成绩,超越现有模型。
  • 人工评估显示,在 0.1% 数据划分下,39.2% 的 Turkers 更偏好 VisualGPT 生成的字幕,且偏好差异具有统计学显著性(p < 0.05)。
  • 与基线相比,该模型表现出更低的对象幻觉和更高的对象覆盖率,在 250 张采样图像中展现出更优的事实一致性。
  • 可视化结果证实,SRAU 机制会为有意义的名词(如 'desk'、'snowy surface')分配高视觉注意力,而为功能词分配低注意力,与人类直觉一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。