Skip to main content
QUICK REVIEW

[论文解读] Generate, Segment and Refine: Towards Generic Manipulation Segmentation

Peng Zhou, Bor-Chun Chen|arXiv (Cornell University)|Nov 24, 2018
Digital Media Forensic Detection参考文献 41被引用 11
一句话总结

该论文提出GSR-Net,一种用于通用篡改分割的新框架,通过基于GAN的生成器解决数据稀缺问题,生成逼真的篡改图像,并采用边界感知的分割与精炼流程,提升对篡改痕迹的检测能力。该方法通过聚焦于边界级痕迹而非语义内容,在四个基准数据集上实现了最先进性能。

ABSTRACT

Detecting manipulated images has become a significant emerging challenge. The advent of image sharing platforms and the easy availability of advanced photo editing software have resulted in a large quantities of manipulated images being shared on the internet. While the intent behind such manipulations varies widely, concerns on the spread of fake news and misinformation is growing. Current state of the art methods for detecting these manipulated images suffers from the lack of training data due to the laborious labeling process. We address this problem in this paper, for which we introduce a manipulated image generation process that creates true positives using currently available datasets. Drawing from traditional work on image blending, we propose a novel generator for creating such examples. In addition, we also propose to further create examples that force the algorithm to focus on boundary artifacts during training. Strong experimental results validate our proposal.

研究动机与目标

  • 解决因人工标注成本高而导致的篡改图像分割训练数据不全面的问题。
  • 通过生成逼真且具有挑战性的篡改图像样本,模拟真实世界篡改行为,提升模型泛化能力。
  • 引导模型关注边界痕迹——篡改的关键指标——而非语义内容。
  • 设计一种自精炼训练循环,通过迭代生成具有新型边界痕迹的新样本,提升对细微篡改线索的检测能力。
  • 仅使用COCO风格的物体标注即可实现有效分割,降低对专用标注数据集的依赖。

提出的方法

  • 提出一种基于GAN的生成器,通过基于混合的损失函数优化图像真实性,将篡改区域自然融合到源图像中。
  • 设计三阶段GSR-Net架构:(1) 从复制粘贴图像中生成困难样本,(2) 使用特征拼接实现边界引导的语义分割,(3) 通过用真实区域替换预测边界来生成新训练样本,实现精炼。
  • 集成边界分支以检测篡改痕迹,同时通过边界预测结果填充内部区域的分割分支。
  • 利用精炼阶段生成具有新型边界痕迹的逼真篡改图像,并将其反馈至分割网络以实现持续学习。
  • 利用分割网络中的低层特征增强边界定位能力,改善特征表征。
  • 在精炼阶段共享权重,实现端到端联合训练,提升推理效率。

实验结果

研究问题

  • RQ1基于GAN的生成器能否生成逼真且难以察觉的篡改图像样本,从而提升分割泛化能力?
  • RQ2聚焦于边界痕迹而非语义内容,是否能带来更优的图像篡改检测效果?
  • RQ3一种通过迭代生成具有新型边界痕迹新样本的自精炼训练循环,能否提升模型鲁棒性?
  • RQ4仅在COCO风格物体标注数据上进行训练的模型,在不依赖专用标注数据集的情况下,其泛化能力能达到何种程度?
  • RQ5在JPEG压缩和图像缩放攻击下,所提框架与现有方法相比在鲁棒性方面表现如何?

主要发现

  • GSR-Net在四个基准数据集上均取得最先进F1分数:Carvalho数据集为0.418,In-The-Wild数据集为0.479,COVER数据集为0.381,CASIA数据集为0.331,优于先前方法。
  • 与基线模型(CP + S)相比,精炼阶段(CP + GSR)在Carvalho数据集上提升F1分数6.5%,在In-The-Wild数据集上提升9.3%,证明其在聚焦边界痕迹方面的有效性。
  • 使用生成图像(DL + G)优于仅使用复制粘贴图像(DL + CP),而结合两者(DL + CP + G)取得最佳性能,表明二者具有互补优势。
  • 模型在JPEG压缩和图像缩放攻击下保持稳定性能,优于RGB-N、EXIF-selfconsistency和MFCN,在鲁棒性方面表现更优。
  • 即使仅在COCO物体标注数据上训练,且未使用CASIA 2.0的篡改数据,GSR-Net在CASIA数据集上仍取得0.331的F1分数,表明其具备强大泛化能力。
  • 定性结果表明,边界分支能成功检测细微篡改痕迹,分割分支在拼接与复制-移动篡改中均能准确填充篡改区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。