[论文解读] Towards Effective Image Manipulation Detection with Proposal Contrastive Learning
本文提出了一种新型自监督模块——提案对比学习(Proposal Contrastive Learning, PCL),通过在对象提案特征上进行对比学习,利用篡改区域与真实区域之间的空间关系,提升图像篡改检测性能。通过采用双流架构(RGB与噪声视图)并同时利用有标签和无标签数据,PCL增强了特征的判别能力,并在多个基准测试中实现了稳定的性能提升。
Deep models have been widely and successfully used in image manipulation detection, which aims to classify tampered images and localize tampered regions. Most existing methods mainly focus on extracting global features from tampered images, while neglecting the relationships of local features between tampered and authentic regions within a single tampered image. To exploit such spatial relationships, we propose Proposal Contrastive Learning (PCL) for effective image manipulation detection. Our PCL consists of a two-stream architecture by extracting two types of global features from RGB and noise views respectively. To further improve the discriminative power, we exploit the relationships of local features through a proxy proposal contrastive learning task by attracting/repelling proposal-based positive/negative sample pairs. Moreover, we show that our PCL can be easily adapted to unlabeled data in practice, which can reduce manual labeling costs and promote more generalizable features. Extensive experiments among several standard datasets demonstrate that our PCL can be a general module to obtain consistent improvement. The code is available at https://github.com/Sandy-Zeng/PCL.
研究动机与目标
- 为解决现有深度学习方法在图像篡改检测中的局限性,即主要关注全局特征而忽略了篡改区域与真实区域之间的局部空间关系。
- 通过利用单幅图像中篡改区域与真实区域之间的内在空间相关性,提升特征的判别能力。
- 开发一种能有效利用无标签数据(在现实场景中常见)的方法,从而减少对昂贵像素级标注的依赖。
- 在目标检测框架内于提案级别集成对比学习,实现对图像篡改更好的定位与分类。
提出的方法
- 该方法采用双流主干网络,从RGB和噪声视图(通过SRM滤波器或约束卷积生成)中提取特征,实现视图不变的表征学习。
- 引入基于提案的对比学习目标,其中正样本对(如同一幅图像中的篡改与真实区域)的特征被拉近,而负样本对则被推开。
- 对比损失在提案级别应用,利用目标检测器生成的区域提案构成正负样本对,无需额外的数据增强。
- 该框架支持监督和半监督训练,使模型可在有标签数据上微调,并进一步利用无标签数据进行优化。
- 通过使用噪声视图捕捉语义无关的特征,增强模型检测细微篡改痕迹的能力。
- 该方法为即插即用设计,可轻松集成到现有的基于目标检测的图像篡改检测流程中。
实验结果
研究问题
- RQ1利用篡改区域与真实区域之间的局部空间关系,是否能改善图像篡改检测的特征表示?
- RQ2与基于全局特征的方法相比,提案级别的对比学习在提升检测性能方面有多有效?
- RQ3在半监督学习设置下,该方法是否能从无标签数据中获益,从而降低标注成本?
- RQ4采用RGB与噪声视图的双流架构是否能提升对多种篡改类型的鲁棒性?
- RQ5与最先进的基于分割的方法相比,该方法在定位精度和标注效率方面表现如何?
主要发现
- PCL在多个标准数据集(包括NIST16和IMD20)上均实现了稳定的性能提升,无论在监督还是半监督设置下,F1分数和平均精度(AP)均有显著提高。
- 在NIST16数据集上,PCL在F1评估中优于现有方法,展现出强大的泛化能力和定位能力。
- 当应用于无标签数据时,该方法表现出显著的性能增益,证明其在有标签数据稀缺的半监督学习场景中具有有效性。
- 在COVERAGE和CASIA V1数据集上,PCL取得了具有竞争力的结果,尤其在边界框定位方面优于多个强基线模型。
- 尽管在像素级指标(如CASIA数据集)上PCL略逊于部分最先进的基于分割的模型,但其在边界框标注成本更低和检测性能更强方面具有实际优势。
- 失败案例主要源于细微篡改,其中篡改区域在视觉上与背景相似,表明在处理困难样本方面仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。