[论文解读] Reverse Engineering of Generative Models: Inferring Model Hyperparameters from Generated Images
本文提出模型解析(model parsing),一种新颖的逆向工程方法,仅从生成的图像中推断生成模型的超参数(如网络架构和损失函数)。通过提出一种具有四种约束的指纹估计网络(FEN)和一个解析网络(PN),该方法在深度伪造检测和图像归属任务中达到最先进性能,在包含116种生成模型的大规模数据集上对未见过的模型也表现出高精度的泛化能力。
State-of-the-art (SOTA) Generative Models (GMs) can synthesize photo-realistic images that are hard for humans to distinguish from genuine photos. Identifying and understanding manipulated media are crucial to mitigate the social concerns on the potential misuse of GMs. We propose to perform reverse engineering of GMs to infer model hyperparameters from the images generated by these models. We define a novel problem, ``model parsing", as estimating GM network architectures and training loss functions by examining their generated images -- a task seemingly impossible for human beings. To tackle this problem, we propose a framework with two components: a Fingerprint Estimation Network (FEN), which estimates a GM fingerprint from a generated image by training with four constraints to encourage the fingerprint to have desired properties, and a Parsing Network (PN), which predicts network architecture and loss functions from the estimated fingerprints. To evaluate our approach, we collect a fake image dataset with $100$K images generated by $116$ different GMs. Extensive experiments show encouraging results in parsing the hyperparameters of the unseen models. Finally, our fingerprint estimation can be leveraged for deepfake detection and image attribution, as we show by reporting SOTA results on both the deepfake detection (Celeb-DF) and image attribution benchmarks.
研究动机与目标
- 为解决仅能访问生成图像而无法获取权重或训练数据时,对生成模型进行逆向工程的挑战,特别是针对未见过的模型。
- 定义并解决新问题“模型解析”——仅从生成图像中推断模型超参数(如架构和损失函数)。
- 开发一种框架,超越二元深度伪造检测和封闭集图像归属,实现对未知生成模型的开放集识别。
- 收集并发布一个大规模数据集,包含来自116种不同生成模型的10万张图像,用于基准测试。
- 通过提取支持归属与检测的模型指纹,实现对合成媒体的取证分析。
提出的方法
- 提出两阶段框架:首先通过指纹估计网络(FEN)从生成图像中提取模型特异性嵌入,随后通过解析网络(PN)预测超参数。
- 设计FEN时引入四种训练约束——身份、对比、重建和对抗性约束,以确保指纹能够捕捉到模型的判别性、不变性和泛化性特征。
- 在PN中采用分层学习策略,以粗到细的阶段逐步解析超参数,利用不同生成模型之间的结构相似性。
- 在包含10万张图像的大型数据集上,以无监督方式训练FEN,涵盖116种不同的生成模型,包括81种GAN和13种VAE。
- 将学习到的指纹适配于下游任务:通过微调用于图像归属,或与RGB/相位特征结合用于深度伪造检测。
- 采用统一框架,使用相同的指纹表示支持深度伪造检测、图像归属和模型解析。
实验结果
研究问题
- RQ1我们能否仅从生成图像中推断出生成模型的超参数(包括架构和损失函数),而无需访问模型权重或训练数据?
- RQ2学习到的指纹表示能否泛化到训练过程中未见过的生成模型,实现对其生成图像的检测与归属?
- RQ3所提出的指纹估计网络在捕捉多样化架构与损失函数下的模型特异性特征方面有多有效?
- RQ4基于指纹的方法是否在未见过的模型上,优于现有深度伪造检测与图像归属方法?
- RQ5指纹能否用于检测利用同一底层生成模型的协同误导信息传播活动?
主要发现
- 所提出的模型解析框架在Celeb-DF基准测试中实现了深度伪造检测的最先进性能,即使未使用像素级监督,也优于先前方法。
- 在Celeb-DF数据集上,该方法在所有对比方法中取得了最高的AUC,即使其他方法使用了更先进的主干网络和额外监督。
- 指纹估计网络对未见过的生成模型具有良好的泛化能力,当测试图像均来自未见模型时,仅有约30%的样本被错误分类。
- 在CelebA和LSUN数据集上的图像归属性能超越了先前工作,证明了指纹在多样化数据分布下的鲁棒性与泛化能力。
- 将解析网络用于分类任务时进行微调,性能反而劣于使用预训练指纹,表明指纹比完整网络更具有信息量,适用于检测任务。
- 该框架成功实现开放集识别,能够以高可靠性检测出此前未见过的生成模型所生成的图像。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。