[论文解读] Data Efficient Language-supervised Zero-shot Recognition with Optimal Transport Distillation
OTTER 提出了一种数据高效的零样本识别方法,通过最优传输蒸馏改进对比学习,通过建模软性的、多对多的图文匹配关系,而非依赖噪声较大的硬标签。在仅使用 300 万对图像-文本对训练的情况下,OTTER 在 42 项评估中超越了 InfoNCE、标签平滑和知识蒸馏,实现了 Google Open Images 和 ImageNet 10K 上的最先进性能,FH@10 的提升最高达 6.6 分。
Traditional computer vision models are trained to predict a fixed set of predefined categories. Recently, natural language has been shown to be a broader and richer source of supervision that provides finer descriptions to visual concepts than supervised "gold" labels. Previous works, such as CLIP, use InfoNCE loss to train a model to predict the pairing between images and text captions. CLIP, however, is data hungry and requires more than 400M image-text pairs for training. The inefficiency can be partially attributed to the fact that the image-text pairs are noisy. To address this, we propose OTTER (Optimal TransporT distillation for Efficient zero-shot Recognition), which uses online entropic optimal transport to find a soft image-text match as labels for contrastive learning. Based on pretrained image and text encoders, models trained with OTTER achieve strong performance with only 3M image text pairs. Compared with InfoNCE loss, label smoothing, and knowledge distillation, OTTER consistently outperforms these baselines in zero shot evaluation on Google Open Images (19,958 classes) and multi-labeled ImageNet 10K (10032 classes) from Tencent ML-Images. Over 42 evaluations on 7 different dataset/architecture settings x 6 metrics, OTTER outperforms (32) or ties (2) all baselines in 34 of them.
研究动机与目标
- 为解决在大规模噪声图像-文本数据集上进行零样本识别时对比学习的数据效率低下问题。
- 通过建模软性的、多对多的图文匹配关系,而非依赖硬性的真实配对,来提升性能。
- 通过利用最优传输技术,从更小、更嘈杂的数据中提炼训练信号,减少对 CLIP 所用 4 亿对大规模数据集的依赖。
- 通过使用熵正则最优传输为未配对的图像和字幕分配概率匹配,提升零样本泛化能力。
- 在极小数据量下实现最先进性能,同时在多样化基准上保持强大的泛化能力。
提出的方法
- OTTER 使用由图像、文本和跨模态相似性组成的相似性矩阵,建模图像与字幕之间的成对匹配得分。
- 应用熵正则化的最优传输方法,计算一批中所有图像-文本对之间的软性、可微分的匹配概率,捕捉多对多关系。
- 该方法引入一种温度软化的对比损失,使用最优传输解作为伪标签,而非硬性真实标签对。
- 采用图像和文本编码器的指数移动平均(EMA)以稳定训练并提升泛化能力。
- 损失函数将最优传输匹配概率与对比目标相结合,联合优化图像和文本表征。
- 该框架仅使用 300 万对图像-文本对端到端训练,与 CLIP 相比显著降低了数据需求。
实验结果
研究问题
- RQ1最优传输能否用于在一批中建模软性的、多对多的图文匹配关系,以改进对比学习?
- RQ2用最优传输生成的概率匹配替代硬性真实标签,是否能提升零样本识别中的数据效率?
- RQ3在多样化基准上,OTTER 与 InfoNCE、标签平滑和知识蒸馏相比,在零样本泛化方面表现如何?
- RQ4相似性矩阵构成和 EMA 对模型稳定性和性能的贡献是什么?
- RQ5仅使用 300 万对图像-文本对训练的模型,能否实现与使用 4 亿对数据的 CLIP 相当或更优的性能?
主要发现
- 在 Google Open Images 和 ImageNet 10K 的 42 项评估中,OTTER 在 32 项中超越了 InfoNCE、标签平滑和知识蒸馏。
- 在 Google Open Images 测试集上,使用 OTTER 训练的 ResNet50 在 FH@1 上超越 CLIP-RN50 2.6 分,在 FH@10 上超越 6.6 分。
- 在相同设置下,使用 OTTER 训练的 ResNet50(参数量 2560 万)优于使用 InfoNCE 训练的更宽的 Wide ResNet50x2(参数量 6840 万)。
- 在 ImageNet 21K+1K 上,OTTER 达到 14.3% 的 FH@10,相对于之前最先进方法 HZSL 提升了 68%(相对)。
- 消融实验表明,若移除图像或文本相似性组件,或禁用 EMA,FH@K=1 的性能最高下降 4.9 分。
- 可视化结果表明,OTTER 能识别出 InfoNCE 视为负样本的有意义未配对图文匹配,证明其具备捕捉细微语义对齐的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。