[论文解读] EfficientCLIP: Efficient Cross-Modal Pre-training by Ensemble Confident Learning and Language Modeling
该论文提出 EfficientCLIP,一种用于高效跨模态预训练的方法,通过集成置信学习(ECL)过滤噪声数据,并在非配对文本数据上进行自监督语言建模以提升泛化能力。该方法仅使用 CLIP 和 WenLan 所需训练资源的 1/10,即在中文跨模态检索任务上达到最先进性能,同时在单模态 NLP 任务中表现优异。
While large scale pre-training has achieved great achievements in bridging the gap between vision and language, it still faces several challenges. First, the cost for pre-training is expensive. Second, there is no efficient way to handle the data noise which degrades model performance. Third, previous methods only leverage limited image-text paired data, while ignoring richer single-modal data, which may result in poor generalization to single-modal downstream tasks. In this work, we propose an EfficientCLIP method via Ensemble Confident Learning to obtain a less noisy data subset. Extra rich non-paired single-modal text data is used for boosting the generalization of text branch. We achieve the state-of-the-art performance on Chinese cross-modal retrieval tasks with only 1/10 training resources compared to CLIP and WenLan, while showing excellent generalization to single-modal tasks, including text retrieval and text classification.
研究动机与目标
- 降低大规模跨模态预训练的高计算成本。
- 解决弱监督互联网数据中数据噪声导致的模型性能下降问题。
- 通过利用大量非配对文本数据,提升跨模态模型在单模态 NLP 任务中的泛化能力。
- 在显著减少训练资源的前提下,实现在跨模态检索任务上的最先进性能。
- 开发一种鲁棒、高效且通用的中文语言跨模态模型。
提出的方法
- 采用集成置信学习(ECL)方法,通过在不同训练阶段训练的多个模型,迭代识别并剔除噪声图像-文本对。
- 利用不同训练阶段的多个影子模型的预测结果,估计数据置信度,提升噪声检测能力。
- 利用大规模非配对单模态文本数据,通过对比学习(如 SimCSE 风格)和掩码语言建模,对文本编码器进行自监督预训练。
- 使用 CLIP 的 ViT-B/32 初始化图像编码器,以获得鲁棒的视觉表征,降低训练成本并提升收敛速度。
- 应用数据蒸馏和基于 MMAP 的内存映射技术,加速数据加载并减少 GPU 显存占用。
- 在零样本设置下训练模型,仅在文本分类任务上进行微调。
实验结果
研究问题
- RQ1在无需完全监督标签的情况下,集成置信学习能否有效降低跨模态预训练中的数据噪声?
- RQ2非配对单模态文本数据能否显著提升跨模态模型在下游 NLP 任务中的泛化能力?
- RQ3在仅使用 CLIP 和 WenLan 所需训练资源 1/10 的情况下,跨模态模型能否在中文基准上实现最先进性能?
- RQ4自监督语言建模的引入是否能同时提升跨模态和单模态性能?
- RQ5在不同训练阶段使用多个影子模型如何提升数据过滤效果和模型收敛性?
主要发现
- EfficientCLIP 在 AIC-ICC 中文跨模态检索基准上达到 18.02% 的 R@1,优于 WenLan 的 3.6% 和 CLIP 的 4.39%,且仅使用 1/10 的训练资源。
- 在 COCO 文本到图像检索任务中,EfficientCLIP 达到 40.40% 的 R@1,超过 CLIP 的 38.34%。
- 在文本检索任务(LCQMC)中,EfficientCLIP 达到 98.88% 的 R@10,超过 CLIP(96.18%)和 SimCSE(97.32%)。
- 在文本分类任务(AFQMC)中,EfficientCLIP 达到 81.58% 的准确率,优于 CLIP(74.53%)和 SimCSE(78.56%)。
- 使用集成评分影子模型将文本检索性能从 42.04% 提升至 43.48% 的 R@1,证明了模型集成在数据过滤中的有效性。
- 使用 24 GPU 天进行 SimCSE 风格预训练,240 GPU 天进行 EfficientCLIP 训练(仅为 CLIP 和 WenLan 所需资源的 1/10),验证了其效率优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。