Skip to main content
QUICK REVIEW

[论文解读] Constrained R-CNN: A general image manipulation detection model

Chao Yang, Huizhou Li|arXiv (Cornell University)|Nov 19, 2019
Digital Media Forensic Detection参考文献 16被引用 5
一句话总结

Constrained R-CNN 提出了一种通用的、端到端的、从粗到精的架构,用于图像篡改检测,能够联合执行篡改分类与精确定位。通过使用可学习的特征提取器、基于注意力的区域建议网络以及跳跃连接融合,该方法在 NIST16、COVERAGE 和 Columbia 数据集上分别实现了 F₁ 分数提升 28.4%、73.2% 和 13.3%,达到当前最先进性能。

ABSTRACT

Recently, deep learning-based models have exhibited remarkable performance for image manipulation detection. However, most of them suffer from poor universality of handcrafted or predetermined features. Meanwhile, they only focus on manipulation localization and overlook manipulation classification. To address these issues, we propose a coarse-to-fine architecture named Constrained R-CNN for complete and accurate image forensics. First, the learnable manipulation feature extractor learns a unified feature representation directly from data. Second, the attention region proposal network effectively discriminates manipulated regions for the next manipulation classification and coarse localization. Then, the skip structure fuses low-level and high-level information to refine the global manipulation features. Finally, the coarse localization information guides the model to further learn the finer local features and segment out the tampered region. Experimental results show that our model achieves state-of-the-art performance. Especially, the F1 score is increased by 28.4%, 73.2%, 13.3% on the NIST16, COVERAGE, and Columbia dataset.

研究动机与目标

  • 解决现有图像篡改检测模型中手工设计或预设特征的局限性。
  • 克服当前方法中仅关注定位而忽略篡改技术分类的不平衡问题。
  • 开发一种统一的、通用的模型,能够同时检测和分类多种内容篡改类型(例如,拼接、复制-粘贴、删除等)。
  • 通过受真实世界法医学工作流程启发的从粗到精架构设计,提升检测的鲁棒性与精确度。
  • 实现从数据中直接端到端学习伪造线索,而无需依赖人工设计的特征。

提出的方法

  • 提出一种基于约束卷积层的可学习篡改特征提取器(LMFE),以从原始图像数据中自动学习统一的伪造表征。
  • 在第一阶段设计一种注意力区域建议网络(RPN-A),用于识别候选篡改区域,并实现粗粒度定位与分类。
  • 在第二阶段引入跳跃连接结构,融合多层级特征(低层级与高层级),以增强全局特征表征。
  • 利用第一阶段的边界框预测作为先验知识,引导第二阶段聚焦于局部区域,实现细粒度分割。
  • 采用源自 Mask R-CNN 的两阶段检测框架,对整个模型进行端到端训练,联合优化分类与分割任务。
  • 应用数据增强技术,如翻转、噪声注入和 JPEG 压缩,以提升泛化能力与鲁棒性。

实验结果

研究问题

  • RQ1深度学习模型是否能够在不依赖手工特征的情况下,联合实现高精度的篡改分类与精确定位?
  • RQ2与单阶段模型相比,从粗到精的架构在图像篡改检测与分割方面有何改进?
  • RQ3可学习特征提取器在捕捉多样化伪造模式方面,与传统预设滤波器(如 SRM、CFA)相比,能有多大优势?
  • RQ4引入注意力机制与跳跃连接是否能增强复杂图像法医学任务的特征表征能力?
  • RQ5该模型在包含不同篡改类型与图像质量的多样化数据集上,泛化能力如何?

主要发现

  • Constrained R-CNN 在四个基准数据集(NIST16、COVERAGE、Columbia 和 CASIA)上均达到最先进性能。
  • 与先前方法相比,该模型在 NIST16 数据集上 F₁ 分数提升 28.4%,在 COVERAGE 上提升 73.2%,在 Columbia 数据集上提升 13.3%。
  • 在 NIST16 数据集上,Constrained R-CNN 实现了 0.939 的平均精度均值(mAP),优于 RGB-N(0.934),并在复制-粘贴检测任务中取得显著提升(mAP 达 0.999)。
  • 跳跃连接结构显著提升了性能,其中 Ours-Base(无跳跃连接)在所有数据集上均表现逊于 Constrained R-CNN。
  • 图像翻转作为数据增强手段带来了最一致的性能提升,而 JPEG 压缩则在 CASIA 数据集上增强了模型表现。
  • 定性结果表明,与 RGB-N 和 MT-Net 相比,Constrained R-CNN 生成的分割掩码更准确、更少噪声,尤其在复杂篡改案例中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。