[论文解读] Contrastive Learning with Large Memory Bank and Negative Embedding Subtraction for Accurate Copy Detection
该论文提出了一种带有大内存库和负嵌入减法的对比学习框架,用于实现精确的图像复制检测。通过使用渐进式分辨率和复杂数据增强训练 EfficientNetV2,并应用一种新颖的后处理步骤以减去相似的负嵌入,该方法在 Facebook AI 图像相似性挑战赛:描述符赛道中取得最先进性能,µAP 达到 0.7743,P90 召回率(Recall@P90)为 0.6892,荣获第一名。
Copy detection, which is a task to determine whether an image is a modified copy of any image in a database, is an unsolved problem. Thus, we addressed copy detection by training convolutional neural networks (CNNs) with contrastive learning. Training with a large memory-bank and hard data augmentation enables the CNNs to obtain more discriminative representation. Our proposed negative embedding subtraction further boosts the copy detection accuracy. Using our methods, we achieved 1st place in the Facebook AI Image Similarity Challenge: Descriptor Track. Our code is publicly available here: \url{https://github.com/lyakaap/ISC21-Descriptor-Track-1st}
研究动机与目标
- 为解决在大型数据库中检测图像修改副本的挑战,这是内容完整性和抄袭检测中的关键问题。
- 通过使用大跨批次内存库的对比学习,提升表示学习能力,以改进复制检测。
- 通过渐进式训练并逐步引入更复杂的数据增强,提升模型的泛化能力和鲁棒性。
- 开发一种后处理技术,通过向量减法将查询嵌入与困难负样本分离。
- 在具有挑战性的 DISC21 数据集上实现最先进性能,如 Facebook AI 图像相似性挑战赛所验证。
提出的方法
- 使用跨批次内存库进行对比学习训练 EfficientNetV2 主干网络,以提升负采样的多样性与表示的可区分性。
- 采用多阶段渐进式训练策略,将输入分辨率从 256×256 逐步提升至 512×512,并逐步引入更复杂的数据增强。
- 应用全面的数据增强流水线,包括裁剪、旋转、透视变换、叠加文字/表情符号以及 JPEG 压缩,经过仔细调整以模拟真实世界中的图像操作。
- 在最终训练阶段,将公开阶段1数据集中的真实配对作为正样本对,以增强模型对人工编辑困难样本的学习能力。
- 提出负嵌入减法:一种后处理方法,通过迭代地从查询描述符中减去最接近的 k 个邻居嵌入,以抑制来自相似但错误的负样本的干扰。
- 在减法后对最终描述符进行归一化,以保持单位向量长度,确保与基于相似度的检索兼容。
实验结果
研究问题
- RQ1在对比学习中使用大内存库是否能显著提升图像嵌入在复制检测中的判别能力?
- RQ2通过逐步引入更复杂的数据增强进行渐进式训练,是否能提升模型对真实世界图像操作的鲁棒性?
- RQ3一种简单的后处理技术如负嵌入减法,是否能通过将查询嵌入与困难负样本分离,显著提升检索性能?
- RQ4当禁止参考集重叠时,使用训练集图像作为困难负样本的代理是否有效?
- RQ5所提出方法在参考集之外的泛化能力如何,是否会出现过拟合?
主要发现
- 该方法在阶段1的私有测试集上实现了 µAP 0.7743 和 Recall@P90 0.6892,显著优于基线方法。
- 使用真实配对进行最终训练步骤(Trained w/ GT)带来了最大的性能提升,使 µAP 从 0.6435 提升至 0.7557。
- 仅负嵌入减法后处理便使 µAP 提升 0.0188,Recall@P90 提升 0.0488,证明其具有显著影响。
- 在最终训练步骤中用训练集图像替代参考图像,仅导致 µAP 下降 0.0057,表明方法具有鲁棒性且未出现过拟合。
- 该方法在 Facebook AI 图像相似性挑战赛:描述符赛道中获得第一名,最终排行榜 µAP 为 0.7743,Recall@P90 为 0.6892。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。