Skip to main content
QUICK REVIEW

[论文解读] Data from Model: Extracting Data from Non-robust and Robust Models

Philipp Benz, Chaoning Zhang|arXiv (Cornell University)|Jul 13, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用 8
一句话总结

本文提出 Data from Model (DfM),一种通过基于梯度的优化方法,利用替代数据集和虚拟 logits 从训练好的模型中提取数据的技术。实验表明,基于提取数据训练的模型仍能保持高准确率,尤其是鲁棒模型,证实了特征映射是数据与模型之间的核心关联。

ABSTRACT

The essence of deep learning is to exploit data to train a deep neural network (DNN) model. This work explores the reverse process of generating data from a model, attempting to reveal the relationship between the data and the model. We repeat the process of Data to Model (DtM) and Data from Model (DfM) in sequence and explore the loss of feature mapping information by measuring the accuracy drop on the original validation dataset. We perform this experiment for both a non-robust and robust origin model. Our results show that the accuracy drop is limited even after multiple sequences of DtM and DfM, especially for robust models. The success of this cycling transformation can be attributed to the shared feature mapping existing in data and model. Using the same data, we observe that different DtM processes result in models having different features, especially for different network architecture families, even though they achieve comparable performance.

研究动机与目标

  • 研究深度学习的逆过程:从训练好的模型中提取数据。
  • 检验模型学习到的特征映射是否可在不访问原始训练数据的情况下被恢复和重用。
  • 比较不同模型架构和训练方式(非鲁棒与鲁棒)下特征映射的稳定性和兼容性。
  • 评估 Data-to-Model 与 Model-to-Data 循环过程在多次迭代中是否能保持模型性能。
  • 理解不同模型运行从同一数据集中学习到的特征表示是独立的还是共享的。

提出的方法

  • 使用带 $l_2$-损失的投影梯度下降(PGD)从模型的 logits 中生成合成数据,以替代图像和虚拟 logits 作为目标。
  • 采用从正态分布 $\mathcal{N}(\mu, \sigma)$ 中采样的虚拟 logits 来建模原始 DNN 的目标 logit 行为。
  • 通过标准反向传播将 DfM 生成的数据用于重新训练模型,最小化输出 logits 与存储的真实标签 logits 之间的 $l_2$ 距离。
  • 通过迭代链式执行 Data-to-Model(DtM)和 DfM 过程,评估多轮循环中的信息保留情况。
  • 在基于提取数据训练的模型之间进行交叉训练与交叉评估,以评估特征的兼容性与可迁移性。
  • 在 MNIST 和 CIFAR-10 上评估性能,使用标准训练和对抗性训练的模型,比较不同架构和训练类型下的准确率。

实验结果

研究问题

  • RQ1在无法访问原始训练数据的情况下,能否有效从训练好的深度神经网络中提取数据?
  • RQ2在提取数据上训练的模型性能与在原始数据集上训练的模型相比如何?
  • RQ3不同模型架构是否从相同数据中学习到相同的或不同的特征映射?
  • RQ4模型鲁棒性(标准训练 vs. 对抗性训练)如何影响提取的特征映射的质量与兼容性?
  • RQ5经过多次 Data-to-Model 与 Model-to-Data 变换循环后,特征映射的保留程度如何?

主要发现

  • 在 DfM 提取的数据上训练的模型,其准确率与在原始数据集上训练的模型相当,性能下降极小——尤其在鲁棒模型中表现更佳。
  • 对于非鲁棒模型,一次 DfM-DtM 循环后准确率下降适中(例如在 CIFAR-10 上下降约 3–5%),而鲁棒模型则表现出近乎相同的性能(例如在 ResNet50 上分别为 90.2% 和 90.5%)。
  • 交叉评估显示,从相同架构但不同运行中提取数据训练的模型,在彼此数据上的准确率仅为 ~40–60%,表明学习到的特征映射各不相同。
  • 相同架构家族(如 VGG 或 ResNet)的模型之间特征映射兼容性更高,当在彼此的提取数据上进行交叉评估时,准确率可达 ~60%。
  • 鲁棒模型展现出更一致且可迁移的特征映射,表现为更高的跨架构准确率(例如在 ResNet50 上,使用鲁棒提取数据重新训练后准确率可达 90.3–91.6%)。
  • DtM 与 DfM 的循环过程可在多次迭代中保持模型性能,准确率下降有限,证实了学习到的特征映射具有稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。