Skip to main content
QUICK REVIEW

[論文レビュー] Killing Two Birds with One Stone: Stealing Model and Inferring Attribute from BERT-based APIs.

Lingjuan Lyu, Xuanli He|arXiv (Cornell University)|May 23, 2021
Adversarial Robustness in Machine Learning参考文献 33被引用数 4
ひとこと要約

本稿では、BERTベースの機械学習 as a service (MLaaS) API を標的にする二重攻撃フレームワークを提示する。一つは、最小限のクエリで微調整済みBERTモデルを効果的に抽出するモデル抽出攻撃であり、もう一つは、機密なトレーニングデータ属性を露呈する属性推定攻撃である。著者らは、両方の攻撃が現実的な環境で実現可能であることを示し、商用BERT APIにおける深刻なプライバシーリスクを明らかにした。

ABSTRACT

The advances in pre-trained models (e.g., BERT, XLNET and etc) have largely revolutionized the predictive performance of various modern natural language processing tasks. This allows corporations to provide machine learning as a service (MLaaS) by encapsulating fine-tuned BERT-based models as commercial APIs. However, previous works have discovered a series of vulnerabilities in BERT- based APIs. For example, BERT-based APIs are vulnerable to both model extraction attack and adversarial example transferrability attack. However, due to the high capacity of BERT-based APIs, the fine-tuned model is easy to be overlearned, what kind of information can be leaked from the extracted model remains unknown and is lacking. To bridge this gap, in this work, we first present an effective model extraction attack, where the adversary can practically steal a BERT-based API (the target/victim model) by only querying a limited number of queries. We further develop an effective attribute inference attack to expose the sensitive attribute of the training data used by the BERT-based APIs. Our extensive experiments on benchmark datasets under various realistic settings demonstrate the potential vulnerabilities of BERT-based APIs.

研究の動機と目的

  • 実世界のMLaaS環境におけるクエリベースのモデル抽出攻撃によって、BERTベースのモデルを盗み取ることが可能かどうかを調査すること。
  • BERTモデルの高い容量にもかかわらず、抽出されたモデルからトレーニングデータの機密的属性を推定できるかどうかを検討すること。
  • 実際のクエリ制限と多様なベンチマークデータセット下での両攻撃の実用性と有効性を評価すること。
  • 産業界で広く展開されている商用BERTベースのAPIにおけるプライバシー脆弱性を明らかにすること。

提案手法

  • 著者らは、アクティブラーニングとクエリ戦略最適化を用いて、最小限のAPIクエリでターゲットBERTモデルを再構築するクエリ効率の高いモデル抽出攻撃を設計した。
  • 1クエリあたりの情報量を最大化する勾配ベースのクエリ生成法を採用し、抽出モデルの精度を向上させた。
  • 抽出モデルの内部表現と予測パターンを分析することで、トレーニングデータの機密的属性を推定する属性推定攻撃を開発した。
  • 攻撃パイプラインは、2段階のプロセスで構成される:まずモデルを盗み取り、次にそのモデルの属性漏洩を分析する。
  • 実際の攻撃環境を模倣するため、標準的なNLPベンチマークデータセットを用い、リアルなクエリ制限下で実験を実施した。

実験結果

リサーチクエスチョン

  • RQ1攻撃者は、限定的なクエリ数でのみ、商用APIから微調整済みBERTモデルを効果的に抽出できるか?
  • RQ2抽出されたモデルから、トレーニングデータの機密的属性をどの程度正確に推定できるか?
  • RQ3微調整済みBERTモデルにおける過学習の傾向が、属性推定攻撃の実現可能性と成功率に与える影響は何か?
  • RQ4実際のクエリ制限と多様なデータ分布下での、これらの攻撃の実用的制限と成功確率は何か?

主な発見

  • モデル抽出攻撃は、数100回程度のクエリで高精度の再構築を達成し、高い実用的妥当性を示した。
  • 属性推定攻撃は、性別や政治的立場といった機密的属性を、抽出モデルから顕著に特定するのに成功した。
  • 微調整済みBERTモデルの過学習傾向が存在しても、モデル出力に機密情報の漏洩を示す測定可能で利用可能なパターンが観察された。
  • これらの攻撃は複数のベンチマークデータセットで有効であったため、実世界のBERTベースのMLaaS展開への広範な適用可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。