[论文解读] Multi-modal Alignment using Representation Codebook
该论文提出了一种新颖的方法——知识蒸馏代码本学习(CODIS),通过使用共享的可学习代码本,在更高阶且更稳定的聚类级表示上对齐图像和文本特征,实现视觉-语言表征学习。通过对比聚类分配并采用动量蒸馏机制以稳定训练,CODIS在零样本图像-文本检索任务上取得了新的SOTA性能,同时在下游迁移任务中也表现出竞争力。
Aligning signals from different modalities is an important step in vision-language representation learning as it affects the performance of later stages such as cross-modality fusion. Since image and text typically reside in different regions of the feature space, directly aligning them at instance level is challenging especially when features are still evolving during training. In this paper, we propose to align at a higher and more stable level using cluster representation. Specifically, we treat image and text as two "views" of the same entity, and encode them into a joint vision-language coding space spanned by a dictionary of cluster centers (codebook). We contrast positive and negative samples via their cluster assignments while simultaneously optimizing the cluster centers. To further smooth out the learning process, we adopt a teacher-student distillation paradigm, where the momentum teacher of one view guides the student learning of the other. We evaluated our approach on common vision language benchmarks and obtain new SoTA on zero-shot cross modality retrieval while being competitive on various other transfer tasks.
研究动机与目标
- 解决训练过程中视觉与语言特征位于特征空间不同区域所带来的对齐挑战。
- 通过在更高阶表示——聚类分配——上操作,而非单个特征,来提升跨模态对齐效果。
- 通过一种新颖的蒸馏机制稳定训练,该机制指导代码本学习与特征对齐。
- 在不依赖CLIP或ALIGN等大规模数据集的前提下,实现在零样本跨模态检索任务上的SOTA性能。
- 通过基于代码本的对比学习,将单模态自监督学习技术扩展至多模态表征学习。
提出的方法
- 引入一个共享的、可学习的代码本(聚类中心的词典),以表示联合的视觉-语言特征空间。
- 通过比较图像和文本特征的聚类分配进行对比学习,端到端优化代码本与特征编码器。
- 采用基于动量的教师-学生蒸馏框架,其中教师编码器(通过移动平均更新)指导学生网络学习特征与代码本分配。
- 通过基于最优传输的优化目标更新代码本,以最小化模态特征与其分配码字之间的距离。
- 不仅将蒸馏机制应用于特征学习,还用于稳定代码本学习,减少训练过程中的不稳定性。
- 使用混合目标函数进行模型训练,结合掩码语言建模(MLM)、图文匹配(ITM)和带代码本监督的对比损失(ITC)。
实验结果
研究问题
- RQ1与实例级对比学习相比,基于聚类级表示的学习是否能提升视觉-语言对齐的稳定性和性能?
- RQ2在多模态设置中,引入动量蒸馏机制在多大程度上能增强代码本学习与跨模态对齐?
- RQ3在不依赖大规模数据集的前提下,基于代码本的方法在多大程度上可实现零样本检索的SOTA性能?
- RQ4同时学习模态内与跨模态对比信号,是否能提升统一视觉-语言表征的质量?
- RQ5不同的代码本大小与损失加权方案在零样本设置下对最终检索性能有何影响?
主要发现
- CODIS在MSCOCO零样本基准上实现了新的SOTA性能,文本检索的R@1达到59.38%,图像检索的R@1达到44.71%,优于包括ALBEF和CLIP在内的先前方法。
- 消融实验表明,结合模态内与跨模态对齐可使R@1相比纯跨模态对齐提升+1.26%(文本检索)和+0.42%(图像检索)。
- 使用教师特征计算代码本损失相比使用学生特征,在MSCOCO上使文本检索的R@1提升+0.38%。
- 模型展现出强大的对齐能力,Grad-CAM可视化结果表明注意力聚焦于与输入词语语义相关的图像区域。
- 3,000个码字的代码本大小表现最佳,500个码字表现欠佳,而2.0倍代码本大小仅带来相较于3K的微小增益。
- 该方法在MSCOCO和Flickr30K数据集上均表现出一致的性能提升,与无代码本的基线相比,MSCOCO上文本检索的R@1绝对提升达+2.5%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。