Skip to main content
QUICK REVIEW

[論文レビュー] Canary in a Coalmine: Better Membership Inference with Ensembled Adversarial Queries

Yuxin Wen, Arpit Bansal|arXiv (Cornell University)|Oct 19, 2022
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本稿では、特定のデータポイントを含む・含まないモデルを最大限に区別できるように最適化されたアンサンブル化された敵対的クエリを用いる、新たなブラックボックス型メンバーシップインファレンス手法「Canaryアタック」を提案する。単純なデータ拡張に依存するのではなく、識別的なクエリを敵対的に設計することで、特に法的・規制的適用に不可欠な低偽陽性率の状況において、最先端の性能を達成した。この手法は、複数のデータセット、アーキテクチャ、さらには微分プライバシーを適用した状況でも、先行手法を上回っている。

ABSTRACT

As industrial applications are increasingly automated by machine learning models, enforcing personal data ownership and intellectual property rights requires tracing training data back to their rightful owners. Membership inference algorithms approach this problem by using statistical techniques to discern whether a target sample was included in a model's training set. However, existing methods only utilize the unaltered target sample or simple augmentations of the target to compute statistics. Such a sparse sampling of the model's behavior carries little information, leading to poor inference capabilities. In this work, we use adversarial tools to directly optimize for queries that are discriminative and diverse. Our improvements achieve significantly more accurate membership inference than existing methods, especially in offline scenarios and in the low false-positive regime which is critical in legal settings. Code is available at https://github.com/YuxinWenRick/canary-in-a-coalmine.

研究の動機と目的

  • モデルの重みが通常入手できない現実世界の法的・規制的文脈において、効果的なメンバーシップインファレンスを実現する必要性に対応すること。
  • 従来のメンバーシップインファレンスアタックが、元のデータポイントや基本的な拡張にのみ依存するため、モデル挙動のサンプリングが疎らで情報量が少ないという限界を克服すること。
  • 特定のサンプルがモデルの学習データに含まれていたかどうかを信頼性高く検出できる、高 discriminative(識別的)な敵対的クエリを生成する手法を開発すること。
  • 微分プライバシーを含む、さまざまなデータセット、モデルアーキテクチャ、プライバシー防御対策に対して、これらの敵対的クエリの頑健性と転送性を評価すること。
  • データ所有者および規制当局が、GDPRの「消去の権利」などのデータ所有権の遵守を検証できる実用的ツールを提供すること。

提案手法

  • 本手法は、特定のデータポイントを含む・含まないモデル間の出力差を最大限に引き出すように最適化された、敵対的クエリ(摂動を加えた入力)を構築する。
  • 勾配ベースの最適化プロセスを用いて、モデル出力の差を最大にするクエリベクトルを生成し、特に事後確率のsoftmax前のロジットとCarlini-Wagner(CW)損失を最適化対象として選定することで、最良の性能を達成する。
  • 異なるモデルアーキテクチャやデータセットにわたる頑健性と一般化性能を向上させるために、こうした敵対的クエリのアンサンブルを訓練する。
  • ターゲットモデルの重みにアクセスできない状況でも、シャロウモデルでクエリを訓練し、それをターゲットモデルに転送する転送性を活用する。
  • 最適化のターゲットはモデルの信頼度と出力ロジットであり、事後確率のsoftmax前のロジットがオンラインおよびオフライン両設定で最も顕著な改善を示している。
  • 微分プライバシーの下でも評価するため、ノルムクリッピングとノイズ注入を適用し、性能の低下と転送性の程度を評価する。

実験結果

リサーチクエスチョン

  • RQ1ブラックボックス設定において、標準的なデータ拡張と比較して、敵対的に最適化されたクエリはメンバーシップインファレンス性能を著しく向上させるか?
  • RQ2ターゲットモデルが微分プライバシーで訓練された場合、アンサンブル化された敵対的クエリはメンバーシップ検出にどの程度有効か?
  • RQ3事後確率のsoftmax前のロジット、CW損失など、さまざまな最適化目的のうち、どのものが多様なモデルアーキテクチャとデータセットにおいて最も頑健で正確なメンバーシップインファレンスを実現するか?
  • RQ4白ボックスアクセスなしで、シャロウモデルで訓練した敵対的クエリが、未観測のターゲットモデルにどの程度効果的に転送されるか?
  • RQ5提案手法は、先行手法が失敗する低偽陽性率の状況でも、高い真正陽性率を達成できるか?これは法的応用において不可欠である。

主な発見

  • オフライン設定において、Canaryアタックは1%偽陽性率(FPR)における真正陽性率(TPR)を21.98%に達成し、ベースラインのLiRA手法(同じ条件下で9.85%)を著しく上回った。
  • オフライン設定では、事後確率のsoftmax前のロジットを直接最大化する最適化目的が最も優れた性能を示し、TPR@1% FPRが12.60%に達した。これは、次に優れた手法よりも2.75%高い。
  • 微分プライバシー(ε=100)の下でも、CanaryアタックはLiRAの1.18%から1.81%にTPR@1% FPRを向上させ、プライバシー保護防御に対する頑健性が向上したことを示した。
  • 本手法は、CIFAR-10、SVHN、CelebAの3つのデータセット、ResNet-18、WideResNet、DenseNet、VGGの4つのモデルアーキテクチャ、およびオンライン・オフラインの両メンバーシップインファレンス設定において、一貫して性能を向上させた。
  • 強い微分プライバシー(ε=100)の下でも、ターゲットモデルのテスト精度は88%から44%に低下したが、Canaryアタックは依然としてベースライン手法を上回る明確な改善を示しており、その耐性の高さを示している。
  • 事後確率のsoftmax前のロジットを最適化目的として用いることで、最も大きな性能向上が得られた。これは、非ターゲットクラスの信頼度を明示的に抑制しないにもかかわらず、メンバーシップ関連の信号を効果的に捉えていることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。