Skip to main content
QUICK REVIEW

[论文解读] ObjectFormer for Image Manipulation Detection and Localization

Junke Wang, Zuxuan Wu|arXiv (Cornell University)|Mar 28, 2022
Digital Media Forensic Detection被引用 9
一句话总结

ObjectFormer 是一种多模态 Transformer 框架,通过融合 RGB 和高频域特征,利用可学习的对象原型来建模图像级和块级一致性,实现对图像篡改的检测与定位。它在多个基准测试中达到最先进性能,在篡改检测和定位精度方面优于现有方法。

ABSTRACT

Recent advances in image editing techniques have posed serious challenges to the trustworthiness of multimedia data, which drives the research of image tampering detection. In this paper, we propose ObjectFormer to detect and localize image manipulations. To capture subtle manipulation traces that are no longer visible in the RGB domain, we extract high-frequency features of the images and combine them with RGB features as multimodal patch embeddings. Additionally, we use a set of learnable object prototypes as mid-level representations to model the object-level consistencies among different regions, which are further used to refine patch embeddings to capture the patch-level consistencies. We conduct extensive experiments on various datasets and the results verify the effectiveness of the proposed method, outperforming state-of-the-art tampering detection and localization methods.

研究动机与目标

  • 为解决在 RGB 域中不可见但在频率域中可见的细微图像篡改检测挑战。
  • 通过使用可学习的对象原型建模图像级和块级视觉一致性,提升篡改检测性能。
  • 开发一种端到端的多模态 Transformer 框架,联合利用 RGB 和频率特征,实现鲁棒的篡改定位。
  • 在多种数据集上,超越现有最先进方法,在检测准确率和定位精度方面均表现更优。

提出的方法

  • 模型使用离散余弦变换(DCT)从输入图像中提取高频分量,以补充 RGB 特征。
  • 通过卷积层将 RGB 特征与高频特征拼接,形成多模态块嵌入。
  • 使用可学习的对象原型作为中间层表示,通过与块嵌入的交叉注意力机制建模图像级一致性。
  • 通过堆叠的对象编码器和块解码器,迭代优化图像级一致性,从而增强块级一致性建模。
  • 框架采用多任务学习设置,端到端预测全局篡改标签和密集篡改掩码。
  • 通过对象原型与块嵌入之间的交叉注意力实现特征优化,支持分层一致性学习。

实验结果

研究问题

  • RQ1结合 RGB 和频率域特征是否能提升对细微图像篡改痕迹的检测能力?
  • RQ2可学习的对象原型在建模图像级视觉一致性以用于篡改检测方面有多有效?
  • RQ3通过对象原型显式建模块级一致性是否能提升定位精度?
  • RQ4与单模态方法相比,RGB 与高频特征的多模态融合在检测拼接、复制-移动和移除类篡改时表现如何?
  • RQ5架构组件(如对象原型和高频嵌入)对整体模型性能的影响是什么?

主要发现

  • 在 CASIA、Columbia、Coverage、NIST16 和 IMD20 数据集上,ObjectFormer 在篡改定位的 AUC 和 F1 分数上均优于最先进方法。
  • 移除高频嵌入(HFE)后,CASIA 数据集的 AUC 下降 14.6%,NIST16 数据集下降 11.0%,证实其在检测细微痕迹中的关键作用。
  • 若省略边界感知一致性建模(BCIM)组件,CASIA 数据集的 AUC 下降 6.2%,NIST16 数据集下降 2.4%,表明其在边界敏感检测中的重要性。
  • 将对象编码器和解码器替换为普通自注意力模块后,NIST16 数据集的 AUC 下降 5%,F1 下降 12.5%,证明中间层对象表示的价值。
  • 最优对象原型数量为 16 个,在 Columbia 和 CASIA 数据集上达到峰值性能,且性能随数量增加至该值前持续提升。
  • 定性结果表明,与 ManTraNet 和 SPAN 相比,ObjectFormer 生成的篡改掩码更清晰、更准确,尤其在复杂边界的定位上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。