Skip to main content
QUICK REVIEW

[论文解读] CoBIT: A Contrastive Bi-directional Image-Text Generation Model

Haoxuan You, Mandy Guo|arXiv (Cornell University)|Mar 23, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

CoBIT 提出了一种统一的视觉-语言基础模型,通过共享的统一编码器-解码器架构,联合预训练对比学习、图文生成和文图生成任务。通过使图像和文本的统一编码器能够在编码和解码模式之间切换,CoBIT 实现了最先进(SOTA)的零样本性能,包括在 ImageNet 上达到 82.7% 的 top-1 准确率,文图生成的 FID 得分为 9.37,以及图像字幕生成的 CIDEr 得分为 44.8。

ABSTRACT

The field of vision and language has witnessed a proliferation of pre-trained foundation models. Most existing methods are independently pre-trained with contrastive objective like CLIP, image-to-text generative objective like PaLI, or text-to-image generative objective like Parti. However, the three objectives can be pre-trained on the same data, image-text pairs, and intuitively they complement each other as contrasting provides global alignment capacity and generation grants fine-grained understanding. In this work, we present a Contrastive Bi-directional Image-Text generation model (CoBIT), which attempts to unify the three pre-training objectives in one framework. Specifically, CoBIT employs a novel unicoder-decoder structure, consisting of an image unicoder, a text unicoder and a cross-modal decoder. The image/text unicoders can switch between encoding and decoding in different tasks, enabling flexibility and shared knowledge that benefits both image-to-text and text-to-image generations. CoBIT achieves superior performance in image understanding, image-text understanding (Retrieval, Captioning, VQA, SNLI-VE) and text-based content creation, particularly in zero-shot scenarios. For instance, 82.7% in zero-shot ImageNet classification, 9.37 FID score in zero-shot text-to-image generation and 44.8 CIDEr in zero-shot captioning.

研究动机与目标

  • 将三种主要的预训练目标——对比学习、图文生成和文图生成——统一到一个连贯的框架中。
  • 解决现有模型仅在一种或两种目标上进行预训练的局限性,尽管它们使用相同的图像-文本对数据。
  • 提升在视觉与语言任务上的零样本和微调性能,包括图像理解、图像检索、视觉问答(VQA)和内容生成。
  • 通过共享的统一编码器结构,实现单模态编码与解码之间的参数高效知识共享。
  • 证明在单一模型中结合所有三种目标可产生协同增益,且各目标之间无严重冲突。

提出的方法

  • CoBIT 采用一种新颖的统一编码器-解码器架构,其中共享的图像统一编码器和文本统一编码器可通过共享参数在编码和解码模式之间切换。
  • 模型使用交叉注意力解码器,在生成任务中融合编码后的图像和文本表征特征。
  • 在对比学习预训练阶段,两个统一编码器均作为编码器使用,通过对比损失对齐图像和文本嵌入。
  • 在图文生成任务中,图像统一编码器编码图像,文本统一编码器自回归地解码字幕,交叉注意力机制关注编码后的图像特征。
  • 在文图生成任务中,文本统一编码器编码提示词,图像统一编码器自回归地解码图像 token,交叉注意力机制关注编码后的文本特征。
  • 模型在大规模噪声网络爬取的图像-文本数据和图像标注数据上进行预训练,并联合优化对比损失、I2T 损失和 T2I 损失。

实验结果

研究问题

  • RQ1一个单一模型能否通过共享参数有效统一对比学习、图文生成和文图生成?
  • RQ2联合预训练全部三种目标如何影响零样本和微调后在视觉-语言任务上的性能?
  • RQ3图文生成和文图生成目标在多大程度上存在冲突?能否在统一框架中实现协调?
  • RQ4所提出的统一编码器机制(在编码与解码之间共享参数)是否相比独立编码器能提升性能和参数效率?
  • RQ5CoBIT 是否能在无需微调的情况下实现强大的零样本能力,特别是在图像分类、字幕生成和文图生成任务中?

主要发现

  • CoBIT 在 ImageNet 图像分类任务上实现了 82.7% 的零样本 top-1 准确率,表明其具备强大的视觉表征学习能力。
  • 在零样本文图生成任务中,CoBIT 达到了 9.37 的 FID 得分,表明其能从提示词生成高质量且多样化的图像。
  • 在零样本图像字幕生成任务中,CoBIT 获得了 44.8 的 CIDEr 得分,表明生成的字幕与参考描述高度对齐。
  • 经过微调后,CoBIT 在 ImageNet 上的线性探测准确率达到 86.44%,文图生成的 FID 得分为 4.62,VQA 得分为 78.3,显示出强大的迁移能力。
  • 消融实验表明,尽管 T2I 和 I2T 目标存在轻微冲突(例如,添加 T2I 损失后 VQA 性能下降 2.6),但整体框架仍保持稳定且高效。
  • 从零开始训练 CoBIT 而不使用预初始化,仅导致零样本 ImageNet 准确率下降 0.3%,FID 增加 0.2,证实了模型从零开始训练的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。