Skip to main content
QUICK REVIEW

[论文解读] Bag of Tricks and A Strong baseline for Image Copy Detection

Wenhao Wang, Weipu Zhang|arXiv (Cornell University)|Nov 13, 2021
Advanced Image and Video Retrieval Techniques参考文献 34被引用 4
一句话总结

本论文提出了一种基于无监督预训练的强基准方法,采用新颖的描述符拉伸策略进行图像复制检测,在NeurIPS 2021 Facebook AI图像相似性挑战赛描述符赛道中位列526支队伍中的第三名。该方法通过描述符拉伸稳定查询间得分方差,从而提升检索准确率,并利用自监督学习(Barlow-Twins)与数据增强技术,增强了在存在海量干扰图像的真实社交媒体场景下的鲁棒性。

ABSTRACT

Image copy detection is of great importance in real-life social media. In this paper, a bag of tricks and a strong baseline are proposed for image copy detection. Unsupervised pre-training substitutes the commonly-used supervised one. Beyond that, we design a descriptor stretching strategy to stabilize the scores of different queries. Experiments demonstrate that the proposed method is effective. The proposed baseline ranks third out of 526 participants on the Facebook AI Image Similarity Challenge: Descriptor Track. The code and trained models are available at https://github.com/WangWenhao0716/ISC-Track2-Submission.

研究动机与目标

  • 解决在拥有数十亿干扰图像及多样化图像变换的真实社交媒体环境中进行图像复制检测的挑战。
  • 通过用无监督自监督预训练替代监督预训练,提升检索性能,尤其采用Barlow-Twins方法。
  • 在描述符空间中稳定查询间匹配得分方差,这对于在描述符赛道评估协议下保持一致性能至关重要。
  • 开发一种实用且高效的基线方法,在具有挑战性的ISC2021基准上优于现有方法。

提出的方法

  • 在ImageNet上使用Barlow-Twins自监督预训练替代监督预训练,实证结果表明性能更优。
  • 采用深度度量学习基线,并结合多种技巧,包括GeM池化、WaveBlock、高维投影头、可学习矩阵、带困难负样本挖掘的三元组损失以及交叉熵损失。
  • 应用多样化的数据增强方法,包括随机裁剪、色彩抖动、模糊处理、旋转以及叠加操作(文字、表情符号、图像),以提升表征的鲁棒性。
  • 在推理阶段引入描述符拉伸,重新缩放描述符并稳定跨查询得分,近似实现得分归一化,同时不违反描述符赛道的约束条件。
  • 采用多尺度推理(200×200至400×400),结合L2归一化的特征融合,以增强鲁棒性与准确性。
  • 使用YOLOv5进行叠加物检测,以识别并处理图像叠加,使匹配对上的性能提升约1%。

实验结果

研究问题

  • RQ1在真实世界条件下,无监督自监督预训练是否能优于监督预训练用于图像复制检测?
  • RQ2在无法进行得分归一化的前提下,如何稳定查询间描述符得分方差,以提升检索一致性?
  • RQ3数据增强与多尺度推理在多大程度上提升了对未见图像变换的鲁棒性?
  • RQ4在海量干扰场景中,叠加物检测与描述符拉伸对检索性能有何影响?

主要发现

  • 所提出的基线方法在ISC2021测试集上实现了0.73017的微观平均精确率,在描述符赛道中位列526名参赛者中的第三名。
  • 使用Barlow-Twins进行无监督预训练使性能提升超过14%,微观平均精确率从0.39089提升至0.53218。
  • 仅使用描述符拉伸使微观平均精确率提升17.26%,从0.70481提升至0.73017,且未改善单个查询指标,表明得分稳定化是关键机制。
  • 通过YOLOv5实现的叠加物检测带来了约1%的性能提升,通过识别并处理图像叠加物实现。
  • 多尺度测试使性能从71.49%提升至73.02%的微观平均精确率,证实其在鲁棒特征提取中的有效性。
  • 该方法展现出强大的泛化能力,在包含裁剪、模糊、色彩抖动及图像叠加等多种变换的大规模基准上均取得高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。