[论文解读] Generalizable Synthetic Image Detection via Language-guided Contrastive Learning
本文提出 LASTED,一种用于可泛化合成图像检测的语言引导对比学习框架。通过使用语义文本标签(如“真实照片”、“合成绘画”等)增强图像,并将检测任务重新表述为识别任务,LASTED 实现了最先进水平的泛化性能,在未见生成模型上的准确率和 AUC 分别较之前方法提升 22.66% 和 15.24%。
The heightened realism of AI-generated images can be attributed to the rapid development of synthetic models, including generative adversarial networks (GANs) and diffusion models (DMs). The malevolent use of synthetic images, such as the dissemination of fake news or the creation of fake profiles, however, raises significant concerns regarding the authenticity of images. Though many forensic algorithms have been developed for detecting synthetic images, their performance, especially the generalization capability, is still far from being adequate to cope with the increasing number of synthetic models. In this work, we propose a simple yet very effective synthetic image detection method via a language-guided contrastive learning. Specifically, we augment the training images with carefully-designed textual labels, enabling us to use a joint visual-language contrastive supervision for learning a forensic feature space with better generalization. It is shown that our proposed LanguAge-guided SynThEsis Detection (LASTED) model achieves much improved generalizability to unseen image generation models and delivers promising performance that far exceeds state-of-the-art competitors over four datasets. The code is available at https://github.com/HighwayWu/LASTED.
研究动机与目标
- 为应对日益逼真的 AI 生成图像检测这一关键挑战,特别是针对多样且未见的合成模型。
- 超越现有基于分类的方法在分布外生成模型上表现不佳的局限,提升检测器的泛化能力。
- 开发一种利用语言监督与对比学习的取证检测方法,以实现更鲁棒、更具判别性的特征学习。
- 将合成图像检测重新定义为识别问题而非多分类任务,从而在数据有限的情况下提升性能。
提出的方法
- 为训练图像添加精心设计的文本标签:'真实照片'、'真实绘画'、'合成照片'、'合成绘画',以构建图像-文本对。
- 使用对比学习训练联合图像-文本编码器,对齐匹配的图像-文本对,同时解耦语义概念。
- 将检测任务重新表述为识别任务——判断图像是否属于同一类别(真实或合成),而非预测具体类别。
- 用优化于判别性表征学习的特征提取头替代先前方法中使用的最后线性分类器。
- 使用对比损失最大化正样本图像-文本对之间的相似性,同时最小化负样本对之间的相似性,从而实现鲁棒的特征学习。
- 采用受 CLIP 启发的架构,使用图像和文本的双编码器,实现对未见模型的零样本泛化能力。
实验结果
研究问题
- RQ1语言引导的对比学习是否能提升合成图像检测器在多样且未见的生成模型上的泛化能力?
- RQ2将合成图像检测重新定义为识别任务而非多分类任务,是否能带来更好的性能与鲁棒性?
- RQ3当真实图像缺乏自然语言标注时,精心设计的文本标签能否作为有效的监督信号用于取证特征学习?
- RQ4在未见的 GAN 和扩散模型生成图像上,LASTED 与最先进方法相比,在准确率和 AUC 上表现如何?
- RQ5所提出方法在未见图像类型(如医学图像或卫星图像)上的泛化能力如何?
主要发现
- 在未见图像生成模型上,LASTED 相较于最先进竞争对手,准确率提升 22.66%,AUC 提升 15.24%。
- 模型在包括 GAN、DM 和深度伪造模型在内的 10 种多样化测试场景中,平均 AP 保持在 97.5% 的高水平。
- 在 SAN 和深度伪造数据集上,LASTED 显著优于现有方法,而先前检测器在这些数据集上表现出较差的泛化能力。
- 基于识别的建模范式使模型即使在训练数据有限的情况下,也能提取高度判别性的特征。
- 通过文本标签实现的语言监督增强了语义解耦,改善了取证表征的优化。
- 该方法在多种图像类型上泛化良好,但在未见领域(如医学或卫星图像)上性能可能下降,除非补充额外训练数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。