Skip to main content
QUICK REVIEW

[论文解读] Black-Box Ripper: Copying black-box models using generative evolutionary algorithms

Antonio Bărbălau, Adrian Cosma|arXiv (Cornell University)|Oct 21, 2020
Generative Adversarial Networks and Image Synthesis参考文献 38被引用 20
一句话总结

本文提出 Black-Box Ripper,一种生成式进化框架,无需访问教师模型的训练数据或梯度,即可将黑盒神经网络的功能提炼至学生模型。通过在代理数据集上训练变分自编码器(VAE),并利用进化策略优化潜在代码以在黑盒模型中实现高目标类别置信度,该方法在无数据零样本知识蒸馏任务中达到最先进性能,在 CIFAR-100 代理设置下较全透明基线方法高出 10.4%。

ABSTRACT

We study the task of replicating the functionality of black-box neural models, for which we only know the output class probabilities provided for a set of input images. We assume back-propagation through the black-box model is not possible and its training images are not available, e.g. the model could be exposed only through an API. In this context, we present a teacher-student framework that can distill the black-box (teacher) model into a student model with minimal accuracy loss. To generate useful data samples for training the student, our framework (i) learns to generate images on a proxy data set (with images and classes different from those used to train the black-box) and (ii) applies an evolutionary strategy to make sure that each generated data sample exhibits a high response for a specific class when given as input to the black box. Our framework is compared with several baseline and state-of-the-art methods on three benchmark data sets. The empirical evidence indicates that our model is superior to the considered baselines. Although our method does not back-propagate through the black-box network, it generally surpasses state-of-the-art methods that regard the teacher as a glass-box model. Our code is available at: https://github.com/antoniobarbalau/black-box-ripper.

研究动机与目标

  • 开发一种在无法访问其架构、训练数据或梯度的情况下复制黑盒神经网络功能的方法。
  • 解决在真实训练数据不可用的零样本设置下知识蒸馏的挑战。
  • 通过最小化代理数据与真实数据分布之间的差距,提升无数据蒸馏的性能。
  • 证明仅通过 API 级访问和进化优化即可有效逆向工程黑盒模型。
  • 提高对公共机器学习 API 潜在漏洞的认识,并推动人工智能安全与模型保护领域的研究。

提出的方法

  • 在与目标黑盒模型类别不同的代理数据集上训练变分自编码器(VAE)。
  • 通过进化策略优化 VAE 的潜在代码,以最大化黑盒模型对特定目标类别的置信度。
  • 生成的图像虽在视觉上与真实图像差异显著,但在教师模型中表现出高类别激活,提供有效的蒸馏信号。
  • 通过将生成图像作为输入、黑盒模型的输出概率作为目标,训练学生网络完成知识蒸馏。
  • 进化过程迭代提升图像质量,聚焦于纹理和模式相似性,而非语义真实性。
  • 仅在学生网络中反向传播梯度,严格遵守黑盒约束。

实验结果

研究问题

  • RQ1在无教师模型训练数据或架构信息的情况下,学生模型能否实现高准确率的知识蒸馏?
  • RQ2进化策略在生成最大化黑盒模型目标类别置信度的对抗性输入方面有多高效?
  • RQ3具有不同类别和分布的代理数据集在多大程度上可实现有效的知识蒸馏?
  • RQ4所提方法是否优于最先进无数据蒸馏技术,尤其是那些可完全访问教师模型的方法?
  • RQ5能否在仅使用极少 API 调用且无梯度信息的情况下复制黑盒模型功能,从而挑战黑盒模型安全性假设?

主要发现

  • 在以 CIFAR-100(6 个类别)作为代理数据集的 CIFAR-10 上,Black-Box Ripper 达到 94.7% 准确率,较最先进方法高出 10.4%。
  • 在 10 Monkey Species 数据集中,该方法使秃面乌卡里猴类别的置信度达到 99.98%,尽管生成图像在语义上与真实图像无相似性。
  • 消融实验证实,进化策略显著缩小了代理数据与真实数据之间的分布差距,从而提升蒸馏性能。
  • 该框架优于一种可对教师模型进行反向传播的最先进全透明方法,证明了黑盒方法的有效性。
  • 在某一场景中,原始黑盒模型与学生模型之间的准确率差距仅为 3.2%,表明复制具有高度保真度。
  • 视觉分析表明,生成图像依赖纹理模式而非语义内容,与卷积神经网络的纹理偏好一致,但仍能引发教师模型的高置信度响应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。