Skip to main content
QUICK REVIEW

[论文解读] Block-level Double JPEG Compression Detection for Image Forgery Localization

Vinay Kumar Verma, Deepak Singh|arXiv (Cornell University)|Mar 20, 2020
Digital Media Forensic Detection被引用 4
一句话总结

本文提出一种基于深度学习的方法,结合量化DCT系数直方图与相应的量化步长(q-因子),利用DenseNet检测单重和双重压缩的JPEG块,无需对图像进行完整解压缩,实现了伪造定位任务的最先进性能,尤其在小尺寸块和未见过的量化矩阵情况下表现优异。

ABSTRACT

Forged images have a ubiquitous presence in today's world due to ease of availability of image manipulation tools. In this letter, we propose a deep learning-based novel approach which utilizes the inherent relationship between DCT coefficient histograms and corresponding quantization step sizes to distinguish between original and forged regions in a JPEG image, based on the detection of single and double compressed blocks, without fully decompressing the JPEG image. We consider a diverse set of 1,120 quantization matrices collected in a recent study as compared to standard 100 quantization matrices for training, testing, and creating realistic forgeries. In particular, we carefully design the input to DenseNet with a specific combination of quantization step sizes and the respective histograms for a JPEG block. Using this input to learn the compression artifacts produces state-of-the-art results for the detection of single and double compressed blocks of sizes $256 imes 256$ and gives better results for smaller blocks of sizes $128 imes 128$ and $64 imes 64$. Consequently, improved forgery localization performances are obtained on realistic forged images. Also, in the case of test blocks compressed with completely different quantization matrices as compared to matrices used in training, the proposed method outperforms the current state-of-the-art.

研究动机与目标

  • 通过识别单重和双重压缩块来应对在JPEG图像中检测伪造区域的挑战。
  • 克服现有方法仅依赖标准100种量化矩阵的局限性,采用来自近期研究的1,120种真实世界Q-矩阵的多样化数据集。
  • 通过直接从量化DCT系数中学习压缩伪影,避免去量化过程,从而提高伪造定位的准确性。
  • 增强对未见过的量化矩阵的泛化能力,这是真实世界图像取证的关键需求。
  • 在小尺寸块(64×64,128×128)上实现更优性能,并在真实伪造场景中实现稳健检测。

提出的方法

  • 直接从JPEG比特流中提取量化DCT系数,避免完整解压缩带来的舍入和截断误差。
  • 对每个8×8块中64个频率分量的量化DCT系数生成直方图。
  • 将每个DCT频率对应的量化步长(q-因子)作为模型的补充输入特征。
  • 设计一种特定的输入张量,将64个bin的直方图与64维的q-因子向量组合,用于输入DenseNet。
  • 训练DenseNet架构,基于DCT直方图与q-因子的联合表示,对每个块进行单重或双重压缩的分类。
  • 应用步长为32的滑动窗口,对图像中所有块预测双重压缩概率,实现伪造定位。

实验结果

研究问题

  • RQ1仅使用量化DCT系数和q-因子,深度学习模型能否有效区分单重与双重压缩的JPEG块?
  • RQ2与仅使用直方图相比,将q-因子与DCT直方图结合是否能提升检测性能?
  • RQ3所提方法在训练过程中未出现的未见过的量化矩阵上泛化能力如何?
  • RQ4该方法是否在更小的块尺寸(64×64,128×128)上优于现有最先进方法?
  • RQ5在涉及复制-粘贴和模糊处理等真实伪造操作的场景中,该方法在多大程度上提升了伪造定位的准确性?

主要发现

  • 在使用q-因子的情况下,该方法在256×256块上达到93.73%的F1分数,在128×128块上达到91.26%,显著优于Park等人[4](分别为90.30%和87.68%)。
  • 在64×64块上,该方法在不使用q-因子时达到97.43%的F1分数,在使用q-因子时达到95.68%,表明在小尺寸块上实现了显著改进。
  • 在复制-粘贴伪造检测中,该方法达到79.92%的F-measure,高于Park等人[4]的77.04%,表明定位性能更优。
  • 在模糊处理场景中,该方法达到77.44%的F-measure,高于Park等人[4]的74.28%,表明对细微篡改的检测能力更强。
  • 在未见过的Q-矩阵场景下,该方法达到92.83%的测试准确率,优于Park等人[4]的86.69%,展现出强大的泛化能力。
  • 在真实世界伪造检测中,该模型达到94.40%的准确率、91.87%的真正率(TPR)和96.94%的真负率(TNR),优于Park等人[4]的92.26%、87.19%和97.33%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。