[论文解读] Detecting and Localizing Copy-Move and Image-Splicing Forgery
本论文提出一种混合方法,结合深度学习与图像变换技术,特别是离散余弦变换(DCT)和错误等级分析(ELA),以检测并定位复制-移动伪造和图像拼接伪造。基于DCT的模型搭配简单神经网络在所有类别中均取得了最高的F-score(0.87–0.90),尤其在模糊化和增强处理下优于基于CNN的方法;而采用ELA输入的UNet模型则提升了掩码定位精度。
In the world of fake news and deepfakes, there have been an alarmingly large number of cases of images being tampered with and published in newspapers, used in court, and posted on social media for defamation purposes. Detecting these tampered images is an important task and one we try to tackle. In this paper, we focus on the methods to detect if an image has been tampered with using both Deep Learning and Image transformation methods and comparing the performances and robustness of each method. We then attempt to identify the tampered area of the image and predict the corresponding mask. Based on the results, suggestions and approaches are provided to achieve a more robust framework to detect and identify the forgeries.
研究动机与目标
- 开发一个鲁棒的框架,用于检测和定位图像伪造,特别是复制-移动和图像拼接类伪造。
- 比较深度学习模型与传统图像变换方法(如DCT、ELA)在伪造检测中的性能与鲁棒性。
- 通过使用原始图像与ELA变换图像的多输入UNet架构,提升伪造区域的定位精度。
- 评估模型在常见后期处理操作(如模糊化、剪切、通道减少)下的鲁棒性。
- 识别在真实世界图像篡改下,最有效的预处理技术与深度学习模型组合,以实现最高F-score与泛化能力。
提出的方法
- 应用错误等级分析(ELA)检测压缩不一致性,通过揭示原始图像与重新压缩图像之间的差异,突出显示篡改区域。
- 使用离散余弦变换(DCT)提取频域特征,识别图像纹理与结构中的异常,这些异常可指示伪造行为。
- 在ELA和DCT特征上训练基本神经网络与带批量归一化的CNN,用于伪造图像与真实图像的二分类。
- 设计两种基于UNet的分割模型:一种仅使用伪造图像,另一种采用双输入流结构,输入为原始图像与ELA变换后的图像。
- 在双输入UNet中采用ResNet101作为主干网络,以提升特征提取与掩码预测质量。
- 利用损失曲线与收敛性监控来调整训练动态,以验证损失和训练时间作为关键指标。
实验结果
研究问题
- RQ1DCT与ELA两种预处理方法在图像增强(如模糊化、剪切)下的性能与鲁棒性如何比较?
- RQ2将ELA与深度学习模型结合,是否能相比仅使用原始图像,显著提升伪造区域的定位精度?
- RQ3在UNet分割模型中引入多模态输入(原始图像 + ELA图像)对性能有何影响?
- RQ4常见的后期处理技术(如模糊化)在多大程度上会降低不同伪造检测模型的性能?
- RQ5哪种预处理与深度学习架构的组合能在真实世界图像篡改下实现最高的F-score与泛化能力?
主要发现
- 基于DCT的模型搭配简单神经网络在测试集上取得了最高的F-score(0.90),优于所有其他方法,尤其在模糊化与增强处理下表现突出。
- ELA与带批量归一化的CNN结合后,加权F-score为0.65,但在模糊化处理下性能显著下降,表明其鲁棒性有限。
- 采用ResNet101主干网络的双输入UNet模型(原始图像 + ELA图像)在掩码定位质量上相比单输入版本有明显提升,经视觉检查确认。
- DCT模型在模糊化条件下仍保持强劲性能(F-score 0.88),而基于CNN的模型在模糊化后完全无法检测伪造图像,凸显频域分析的鲁棒性。
- CNN-based UNet的训练时间与收敛性更优(每轮93秒,第17轮收敛),而ResNet-based UNet训练时间更长(每轮161秒,未完全收敛),尽管后者验证损失更高。
- 本研究证实,结合DCT或ELA预处理可显著提升模型鲁棒性,尤其当与简单高效的模型(如基本神经网络)结合时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。