Skip to main content
QUICK REVIEW

[論文レビュー] Machine Unlearning: Linear Filtration for Logit-based Classifiers

Thomas Baumhauer, Pascal Schöttle|arXiv (Cornell University)|Feb 7, 2020
Adversarial Robustness in Machine Learning被引用数 12
ひとこと要約

本稿では、ログイットベースの分類器における学習データの全クラスの削除を計算的に効率的な方法として、線形フィルタリングを提案する。モデルのログイットに線形変換(特に正規化または射影)を適用することで、再訓練を伴わずに記憶を低減し、ナチュラルな削除と比較してモデルインバージョン攻撃に対する耐性を顕著に向上させる。CIFAR-10およびMNISTにおける実験でその有効性が示された。

ABSTRACT

Recently enacted legislation grants individuals certain rights to decide in what fashion their personal data may be used, and in particular a "right to be forgotten". This poses a challenge to machine learning: how to proceed when an individual retracts permission to use data which has been part of the training process of a model? From this question emerges the field of machine unlearning, which could be broadly described as the investigation of how to "delete training data from models". Our work complements this direction of research for the specific setting of class-wide deletion requests for classification models (e.g. deep neural networks). As a first step, we propose linear filtration as a intuitive, computationally efficient sanitization method. Our experiments demonstrate benefits in an adversarial setting over naive deletion schemes.

研究の動機と目的

  • 法的義務(例:消去の権利)に伴い、機械学習モデルから学習データの全クラスを効率的に削除する課題に対処すること。
  • 再訓練を回避しつつ、モデルの有用性を保ちながら実用的で低コストなアンラーニング手法を開発すること。
  • 特にモデルインバージョン攻撃を含む敵対的プライバシー攻撃を通じて、アンラーニングの有効性を評価し、実世界におけるプライバシー保証を検証すること。
  • 実用的展開にふさわしい、より現実的なブラックボックス定義の弱化されたアンラーニング定義を提案すること。
  • アンラーニング操作が単純で解釈可能なログイットへの変換として実現可能であり、アーキテクチャの変更なしに既存モデルに統合可能であることを示すこと。

提案手法

  • 推論後に分類器のログイットに線形変換(例:正規化または射影)を適用する洗練手法として、線形フィルタリングを提案する。
  • フィルタリング操作が最終層に吸収可能であるような仮説クラスを用い、再訓練を伴わずスムーズに統合可能であることを保証する。
  • 計算オーバーヘッドを最小限に抑えるために、各クラスの代表的データポイントを少数のみ使用して変換を計算する。
  • 変換を単位球面への射影または単位ノルムへの正規化として定義し、バリエーション(例:正規化ベースまたは射影ベースのフィルタリング)に応じて変更する。
  • モデル推論の後処理段階で適用し、モデル出力に対してブラックボックス的に動作させることで、外部からの干渉を回避する。
  • プライバシー漏洩とアンラーニング後のモデル性能を評価するために、Kiefer-Wolfowitz統計量(KSΦ)および分類器アドバンテージ指標を用いる。

実験結果

リサーチクエスチョン

  • RQ1再訓練を伴わず、計算的に効率的な後処理手法として、ログイットベースの分類器で全クラスのデータをアンラーニングできるか?
  • RQ2ナチュラルな削除と比較して、線形フィルタリングは記憶の低減およびモデルインバージョン攻撃の防止においてどの程度有効か?
  • RQ3出力分布の類似性に基づくブラックボックス定義のアンラーニングは、プライバシー保護手法の評価に現実的で実用的なベンチマークを提供できるか?
  • RQ4アンラーニング操作がモデルの最終層に吸収可能であり、アーキテクチャの変更なしに展開可能か?
  • RQ5フィルタリングタイプの選択(例:正規化対射影)が、異なるデータセットにおけるプライバシーおよびモデル性能にどのように影響を与えるか?

主な発見

  • 線形フィルタリングはモデルインバージョン攻撃の成功率を顕著に低減する。CIFAR-10では、アンラーニング後、再構成品質が元のデータにほぼ一致する状態(KSΦ ≈ 0.115)から、ベースライン水準に近い状態(KSΦ ≈ 0.038)にまで低下した。
  • 正規化ベースの線形フィルタリングは敵対的環境下でナチュラルな削除を上回り、CIFAR-10ではKSΦが67%低下し、MNISTでは45%低下した。
  • 本手法はモデルの有用性を維持しており、分類器アドバンテージ指標がアンラーニング後も安定したままであり、予測性能の低下がないことが示された。
  • 提案されたブラックボックスアンラーニング定義は、プライバシー保護手法の評価に有効であり、特に敵対的テストと組み合わせると効果的である。
  • 正規化フィルタリングはCIFAR-10でKSΦ = 0.038、MNISTでKSΦ = 0.10を達成し、ナチュラルな削除(KSΦ = 0.115および0.184)を上回り、残りのクラスではベースライン性能を維持した。
  • 本手法は計算的に軽量であり、各クラスの代表的データポイント数を少数に抑えることで変換を計算可能であり、実世界の展開においてスケーラブルである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。