Skip to main content
QUICK REVIEW

[论文解读] Killing Two Birds with One Stone: Stealing Model and Inferring Attribute from BERT-based APIs.

Lingjuan Lyu, Xuanli He|arXiv (Cornell University)|May 23, 2021
Adversarial Robustness in Machine Learning参考文献 33被引用 4
一句话总结

本文提出了一种针对基于 BERT 的机器学习即服务(MLaaS)API 的双重攻击框架:一种高效的模型提取攻击,可在极少查询次数下窃取微调后的 BERT 模型;以及一种属性推断攻击,可暴露训练数据中的敏感属性。作者证明了这两种攻击在真实场景中均具有可行性,揭示了商业 BERT API 中存在的严重隐私风险。

ABSTRACT

The advances in pre-trained models (e.g., BERT, XLNET and etc) have largely revolutionized the predictive performance of various modern natural language processing tasks. This allows corporations to provide machine learning as a service (MLaaS) by encapsulating fine-tuned BERT-based models as commercial APIs. However, previous works have discovered a series of vulnerabilities in BERT- based APIs. For example, BERT-based APIs are vulnerable to both model extraction attack and adversarial example transferrability attack. However, due to the high capacity of BERT-based APIs, the fine-tuned model is easy to be overlearned, what kind of information can be leaked from the extracted model remains unknown and is lacking. To bridge this gap, in this work, we first present an effective model extraction attack, where the adversary can practically steal a BERT-based API (the target/victim model) by only querying a limited number of queries. We further develop an effective attribute inference attack to expose the sensitive attribute of the training data used by the BERT-based APIs. Our extensive experiments on benchmark datasets under various realistic settings demonstrate the potential vulnerabilities of BERT-based APIs.

研究动机与目标

  • 调查在真实世界 MLaaS 环境中,通过基于查询的模型提取攻击窃取基于 BERT 的模型是否具有可行性。
  • 探究尽管 BERT 模型容量很高,是否仍可从提取的模型中推断出训练数据的敏感属性。
  • 在现实的查询限制和多样化的基准数据集下,评估两种攻击的实际可行性和有效性。
  • 揭示广泛部署于工业界的商业 BERT 基础 API 所存在的隐私漏洞。

提出的方法

  • 作者设计了一种查询高效的模型提取攻击,结合主动学习与查询策略优化,以最少的 API 查询次数重建目标 BERT 模型。
  • 采用基于梯度的查询生成方法,以最大化每次查询的信息增益,从而提高提取模型的准确性。
  • 通过分析提取模型的内部表征和预测模式,开发了一项属性推断攻击,以推断训练数据的敏感属性。
  • 攻击流程采用两阶段设计:首先窃取模型,随后分析其以检测属性泄露。
  • 在标准自然语言处理基准数据集上,在现实查询限制下开展实验,以模拟真实世界的对抗性环境。

实验结果

研究问题

  • RQ1攻击者是否能仅通过有限数量的查询,有效从商业 API 中提取出微调后的 BERT 模型?
  • RQ2在提取的模型中,能在多大程度上推断出训练数据的敏感属性?
  • RQ3微调后的 BERT 模型存在的过拟合倾向,如何影响属性推断攻击的可行性和成功率?
  • RQ4在现实的查询约束和多样化数据分布下,这些攻击的实际限制和成功率如何?

主要发现

  • 模型提取攻击仅使用数百次查询便成功以高保真度重建了目标 BERT 模型,证明了其高度的实际可行性。
  • 属性推断攻击在从提取模型中识别出性别或政治倾向等敏感属性方面取得了显著成功。
  • 即使微调后的 BERT 模型存在过拟合倾向,作者仍观察到可测量且可被利用的模型输出模式,这些模式泄露了属性信息。
  • 这些攻击在多个基准数据集上均表现有效,表明其对现实世界基于 BERT 的 MLaaS 部署具有广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。