[论文解读] Producing augmentation-invariant embeddings from real-life imagery
本论文提出了一种新颖的方法,利用带有ArcFace训练的CNN生成对增强不变的图像嵌入,结合集成学习与两种查询归一化技术。通过利用合成增强、多尺度主干网络和渐进式训练方案,该方法在Facebook AI图像相似性挑战赛中获得了0.59的微平均精度(micro-Average Precision),在第二阶段排名第二。
This article presents an efficient way to produce feature-rich, high-dimensionality embedding spaces from real-life images. The features produced are designed to be independent from augmentations used in real-life cases which appear on social media. Our approach uses convolutional neural networks (CNN) to produce an embedding space. An ArcFace head was used to train the model by employing automatically produced augmentations. Additionally, we present a way to make an ensemble out of different embeddings containing the same semantic information, a way to normalize the resulting embedding using an external dataset, and a novel way to perform quick training of these models with a high number of classes in the ArcFace head. Using this approach we achieved the 2nd place in the 2021 Facebook AI Image Similarity Challenge: Descriptor Track.
研究动机与目标
- 开发一个鲁棒的嵌入空间,使其对社交媒体中常见的现实世界图像增强保持不变。
- 解决大规模图像相似性基准中类别不平衡和参考数据集访问受限的问题。
- 通过在源自真实图像的合成增强数据上进行训练,提升模型泛化能力。
- 利用外部训练数据对查询嵌入进行归一化,以增强相似性分数的一致性。
- 在2021年Facebook AI图像相似性挑战赛描述符赛道中达到最先进性能。
提出的方法
- 使用合成增强数据对多个CNN主干网络(EfficientNetV2、NFNet)进行训练,结合ArcFace头以提升训练多样性。
- 采用可学习参数p的广义均值池化(GeM),随后接一个无偏置的线性层,生成256维嵌入。
- 对最终嵌入应用L2归一化,以确保单位向量表示并提升相似性计算性能。
- 采用渐进式训练策略,逐步增加ArcFace头中的类别数,以加速收敛并提升泛化能力。
- 提出两种查询归一化方法:(1) 通过最近邻训练样本将查询嵌入从单位球面向外扩展;(2) 沿远离最近100个训练嵌入的平均方向移动嵌入。
- 通过模型集成平均融合多个模型,并利用外部数据集(ImageNet、Deepfake Detection)丰富训练数据,但后者因冗余性和训练不稳定性问题最终被弃用。
实验结果
研究问题
- RQ1深度学习模型能否生成对多样化现实世界图像增强保持不变的图像嵌入?
- RQ2在严重类别不平衡和参考数据访问受限的情况下,如何提升模型泛化能力?
- RQ3何种查询归一化方法可确保在不同增强下相似性分数保持一致?
- RQ4集成学习与大规模ArcFace头的渐进式训练是否能显著提升大规模图像相似性任务的性能?
- RQ5使用含人脸内容的外部数据集是否能提升与人脸相关的图像增强的嵌入质量?
主要发现
- 所提方法在Facebook AI图像相似性挑战赛第二阶段取得了0.59的微平均精度(μAP),位列第二。
- 查询归一化方法2——沿远离最近100个训练嵌入的平均方向移动嵌入——使第二阶段μAP从0.53提升至0.59。
- 采用渐进式训练策略(逐步增加ArcFace头类别数)可加速收敛,并在高精度任务上实现更好的泛化性能。
- 融合不同主干网络和输入尺寸的多个模型的集成方法优于单一模型,证明了模型多样性的有效性。
- 外部数据集如ImageNet可提升训练数据多样性,但Deepfake Detection数据集因冗余度高且对训练稳定性产生负面影响,最终被弃用。
- 尽管训练过程中禁止使用参考数据集,最终模型仍表现出优异性能,证明其对未见增强具有强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。