Skip to main content
QUICK REVIEW

[论文解读] StolenEncoder: Stealing Pre-trained Encoders in Self-supervised Learning

Yupei Liu, Jinyuan Jia|arXiv (Cornell University)|Jan 15, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出 StolenEncoder,这是首个针对自监督学习中预训练图像编码器的模型盗取攻击。通过使用小型替代数据集并查询 Encoder-as-a-Service(EaaS)API,同时应用数据增强技术,该攻击训练出一个与目标编码器在特征提取行为上高度相似的盗取编码器,在下游分类任务中实现了与原始编码器相当的准确率,且所需数据和计算资源远少于从零开始预训练。

ABSTRACT

Pre-trained encoders are general-purpose feature extractors that can be used for many downstream tasks. Recent progress in self-supervised learning can pre-train highly effective encoders using a large volume of unlabeled data, leading to the emerging encoder as a service (EaaS). A pre-trained encoder may be deemed confidential because its training requires lots of data and computation resources as well as its public release may facilitate misuse of AI, e.g., for deepfakes generation. In this paper, we propose the first attack called StolenEncoder to steal pre-trained image encoders. We evaluate StolenEncoder on multiple target encoders pre-trained by ourselves and three real-world target encoders including the ImageNet encoder pre-trained by Google, CLIP encoder pre-trained by OpenAI, and Clarifai's General Embedding encoder deployed as a paid EaaS. Our results show that our stolen encoders have similar functionality with the target encoders. In particular, the downstream classifiers built upon a target encoder and a stolen one have similar accuracy. Moreover, stealing a target encoder using StolenEncoder requires much less data and computation resources than pre-training it from scratch. We also explore three defenses that perturb feature vectors produced by a target encoder. Our results show these defenses are not enough to mitigate StolenEncoder.

研究动机与目标

  • 为应对 Encoder-as-a-Service(EaaS)平台中因公开 API 暴露强大预训练编码器而带来的日益增长的知识产权泄露风险。
  • 开发一种新型攻击方法,无需访问目标图像编码器的训练数据或架构,即可盗取其功能行为。
  • 评估现有针对分类器盗取的防御措施在应对编码器盗取攻击时的有效性,并识别其局限性。
  • 证明盗取的编码器在下游任务中可实现与原始目标编码器相当的性能。

提出的方法

  • 将编码器盗取问题建模为一个优化任务,通过最小化在小型替代数据集上由盗取编码器和目标编码器生成的特征向量之间的 L2 距离。
  • 对替代数据集应用数据增强(例如,RandomHorizontalFlip、ColorJitter、RandomGrayScale)以增加多样性,并在训练过程中提升泛化能力。
  • 引入双损失目标:L1 衡量在原始图像上的相似性,L2' 衡量在增强图像上的相似性,两者均通过向目标编码器的 API 查询计算得出。
  • 使用小型、非分布式替代数据集以降低查询成本,同时通过增强和损失优化保持高性能。
  • 端到端训练盗取编码器,利用组合损失使其特征输出与目标编码器保持一致。
  • 在下游分类任务上评估盗取编码器,以衡量其功能保真度。

实验结果

研究问题

  • RQ1是否可以仅通过少量查询和小型替代数据集,从 EaaS API 中有效盗取预训练图像编码器?
  • RQ2训练期间的数据增强如何影响盗取编码器的性能和泛化能力?
  • RQ3盗取编码器在下游分类任务中与目标编码器的功能匹配程度如何?
  • RQ4针对分类器盗取设计的现有防御措施是否对编码器盗取攻击有效?
  • RQ5与从零开始预训练相比,盗取编码器在计算和数据效率方面表现如何?

主要发现

  • 当在包含完整数据增强的 CIFAR-10 替代数据集上训练时,盗取编码器在 GTSRB 数据集上的下游分类准确率达到 79.94%,而未使用增强时仅为 51.50%。
  • 使用全部四种数据增强操作(RandomResizedCrop、RandomHorizontalFlip、ColorJitter、RandomGrayScale)可获得最高性能(准确率达 79.94%),表明增强在其中起着关键作用。
  • 该攻击在下游性能上可与原始目标编码器相媲美,盗取编码器在多个基准测试(包括 CLIP 和 Google 的 ImageNet 编码器)上匹配了目标编码器的准确率。
  • StolenEncoder 所需的数据和计算资源远少于从零开始预训练同等性能的编码器,是一种高度高效的替代方案。
  • 针对分类器盗取而设计的、通过扰动置信度分数的防御措施无法缓解 StolenEncoder 攻击,因为该攻击针对的是特征级相似性,而非预测输出。
  • 该攻击成功盗取了真实世界中的 EaaS 编码器,包括 OpenAI 的 CLIP 和 Google 的 ImageNet 模型,证实了其实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。