[论文解读] Decoupling the Role of Data, Attention, and Losses in Multimodal Transformers
本文研究了预训练数据、注意力机制和损失函数在零样本图像检索的多模态变换器中的作用。研究发现,数据质量——尤其是语言连贯性和图文对齐程度——比数据规模更重要,多模态注意力对性能至关重要,而对比损失在此设置下带来的增益有限,简单的分类损失通常已足够。
Recently multimodal transformer models have gained popularity because their performance on language and vision tasks suggest they learn rich visual-linguistic representations. Focusing on zero-shot image retrieval tasks, we study three important factors which can impact the quality of learned representations: pretraining data, the attention mechanism, and loss functions. By pretraining models on six datasets, we observe that dataset noise and language similarity to our downstream task are important indicators of model performance. Through architectural analysis, we learn that models with a multimodal attention mechanism can outperform deeper models with modality specific attention mechanisms. Finally, we show that successful contrastive losses used in the self-supervised learning literature do not yield similar performance gains when used in multimodal transformers
研究动机与目标
- 理解预训练数据、注意力机制和损失函数如何影响多模态变换器中的表征质量。
- 评估数据噪声和语言相似性是否能预测模型在下游任务中的表现。
- 确定多模态注意力是否比模态特定的注意力机制更有效。
- 评估对比损失是否在多模态变换器中优于分类损失。
- 探究仅图像或仅语言的预训练是否对多模态模型性能有实质性贡献。
提出的方法
- 在多种图像-文本数据集上预训练六个多模态变换器模型,数据集规模和噪声水平各不相同。
- 比较不同注意力机制的模型:多模态注意力(模态间的交叉注意力)、协同注意力(模态特定的注意力)以及无交叉注意力。
- 使用对比匹配损失和标准分类损失(每对样本仅一个负例)进行训练。
- 在未见过的数据集上评估零样本图像检索性能,以衡量学习表征的泛化能力。
- 通过受控的消融研究,分离注意力架构和损失函数的影响。
- 通过探针分析和结构分析研究模型行为,重点关注注意力头分布和特征对齐情况。
实验结果
研究问题
- RQ1数据集规模和噪声水平如何影响多模态变换器在零样本任务中的表现?
- RQ2在表征质量方面,多模态注意力是否优于模态特定的注意力机制?
- RQ3对比损失是否比分类损失更有效地提升多模态表征学习?
- RQ4仅图像或仅语言的预训练组件在多大程度上对最终性能有贡献?
- RQ5是否具备多模态注意力的小型模型能够匹配或超越参数更多、架构更深、注意力类型不同的大型模型?
主要发现
- 数据噪声和语言与下游任务的相似性,比数据集规模更能预测模型性能。
- 具备多模态注意力的模型,即使参数量或深度小于仅使用模态特定注意力的模型,其性能也更优。
- 对比损失在多模态变换器中带来的性能增益极小,而它们在缺乏多模态注意力的模型中则有显著提升。
- 使用每对样本仅一个负例的简单分类损失,即可获得具有竞争力的结果,无需硬负样本挖掘或大规模对比目标。
- 仅图像的预训练和掩码区域建模损失对性能贡献甚微,表明当前损失形式可能未充分利用视觉信号。
- 仅语言的预训练并未显著提升性能,表明联合多模态预训练已足以学习强表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。