[论文解读] Detection, Attribution and Localization of GAN Generated Images
本文提出了一种深度学习方法,通过分析多方向(水平、垂直、对角线)RGB像素邻域的互相关矩阵,实现对 GAN 生成图像的检测、归属判定和定位。该方法在包含超过 276 万张图像的五种 GAN 类型数据集上实现了超过 97% 的高准确率,即使在 JPEG 压缩条件下也表现稳健。
Recent advances in Generative Adversarial Networks (GANs) have led to the creation of realistic-looking digital images that pose a major challenge to their detection by humans or computers. GANs are used in a wide range of tasks, from modifying small attributes of an image (StarGAN [14]), transferring attributes between image pairs (CycleGAN [91]), as well as generating entirely new images (ProGAN [36], StyleGAN [37], SPADE/GauGAN [64]). In this paper, we propose a novel approach to detect, attribute and localize GAN generated images that combines image features with deep learning methods. For every image, co-occurrence matrices are computed on neighborhood pixels of RGB channels in different directions (horizontal, vertical and diagonal). A deep learning network is then trained on these features to detect, attribute and localize these GAN generated/manipulated images. A large scale evaluation of our approach on 5 GAN datasets comprising over 2.76 million images (ProGAN, StarGAN, CycleGAN, StyleGAN and SPADE/GauGAN) shows promising results in detecting GAN generated images.
研究动机与目标
- 应对日益严峻的挑战:检测逼真 GAN 生成的图像,这些图像与真实图像难以区分。
- 克服依赖 GAN 判别器进行检测的局限性,因为初步测试显示其准确率仅为 80.4%。
- 开发一种鲁棒的方法,以检测、归属判定并定位多种 GAN 架构中的 GAN 操纵痕迹。
- 在真实世界条件(如 JPEG 压缩和不同图像尺度)下提升泛化能力。
- 通过基于图像块的分析与热力图可视化,实现对 GAN 生成区域的细粒度定位。
提出的方法
- 对每张图像的局部 RGB 像素邻域,在水平、垂直和对角线方向上计算互相关矩阵。
- 将生成的互相关矩阵直接输入深度神经网络,实现端到端的特征学习,避免手工设计特征。
- 采用基于图像块的策略,使用重叠感受野(例如 128×128 的图像块,步长为 8),以实现对 GAN 生成区域的定位。
- 通过平均重叠像素的响应,聚合图像块级别的得分,生成定位热力图。
- 训练一个多类别分类器,用于将图像归属到特定 GAN 类型:ProGAN、StarGAN、CycleGAN、StyleGAN、SPADE/GauGAN,以及真实图像。
- 通过随机 JPEG 压缩(质量因子 75、85、90 或无压缩)进行数据增强,以提升在真实场景下的鲁棒性。
实验结果
研究问题
- RQ1局部像素邻域的互相关矩阵是否能有效检测多种架构下的 GAN 生成图像?
- RQ2所提出的方法在将 GAN 生成图像归属到其源 GAN 模型方面表现如何?
- RQ3该方法在使用基于图像块的分析时,能在多大程度上实现对图像中 GAN 生成区域的定位?
- RQ4该方法在真实世界图像处理(如 JPEG 压缩)下的鲁棒性如何?
- RQ5在互相关矩阵上训练的深度学习模型是否能优于传统的隐写分析或基于 GAN 判别器的检测方法?
主要发现
- 在无预处理的全图评估中,该方法对真实图像的分类准确率达到 0.975,对 StarGAN 生成图像的准确率达到 0.976。
- ProGAN 检测在全图上的准确率达到 100%,而 CycleGAN 和 StarGAN 的准确率分别为 0.964 和 0.976。
- 在 JPEG 压缩(质量 75–90)条件下,整体准确率略有下降至 0.8088,但模型在所有 GAN 类型上仍保持稳健。
- 定位热力图能清晰区分真实区域(蓝色)与 GAN 生成区域(红色),且在所有 GAN 类型中均呈现一致的空间模式。
- 深度特征的 t-SNE 可视化显示真实图像与 GAN 生成图像呈现出明显的聚类,表明特征分离效果良好。
- SPADE/GauGAN 和 StyleGAN 在全图分类中的准确率较低(分别为 0.902 和 0.975),可能由于数据集规模、图像块大小或训练数据特性所致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。