Skip to main content
QUICK REVIEW

[論文レビュー] Fast Machine Unlearning Without Retraining Through Selective Synaptic Dampening

Jack Foster, Stefan Schoepf|arXiv (Cornell University)|Aug 15, 2023
Advanced Neural Network ApplicationsComputer Science被引用数 3
ひとこと要約

本稿では、Fisher情報行列(FIM)解析を用いて、忘れられたデータに特に寄与するパラメータを特定し、そのパラメータを選択的に減衰させる再トレーニング不要な後処理型機械的忘却手法である選択的シナプス減衰(SSD)を提案する。SSDは、再トレーニングに基づく最先端手法と同等の性能を達成する一方で、再トレーニングに比べて数個のオーダー以上に高速であり、学習データの長期的保存を必要としない。

ABSTRACT

Machine unlearning, the ability for a machine learning model to forget, is becoming increasingly important to comply with data privacy regulations, as well as to remove harmful, manipulated, or outdated information. The key challenge lies in forgetting specific information while protecting model performance on the remaining data. While current state-of-the-art methods perform well, they typically require some level of retraining over the retained data, in order to protect or restore model performance. This adds computational overhead and mandates that the training data remain available and accessible, which may not be feasible. In contrast, other methods employ a retrain-free paradigm, however, these approaches are prohibitively computationally expensive and do not perform on par with their retrain-based counterparts. We present Selective Synaptic Dampening (SSD), a novel two-step, post hoc, retrain-free approach to machine unlearning which is fast, performant, and does not require long-term storage of the training data. First, SSD uses the Fisher information matrix of the training and forgetting data to select parameters that are disproportionately important to the forget set. Second, SSD induces forgetting by dampening these parameters proportional to their relative importance to the forget set with respect to the wider training data. We evaluate our method against several existing unlearning methods in a range of experiments using ResNet18 and Vision Transformer. Results show that the performance of SSD is competitive with retrain-based post hoc methods, demonstrating the viability of retrain-free post hoc unlearning approaches.

研究の動機と目的

  • GDPRなどのデータプライバシー規制に準拠するための機械的忘却の需要が高まっていることを踏まえ、そのニーズに対応すること。
  • 初期処理後、元の学習データにアクセスできない状態でも、保持データにおけるモデル性能を維持できる再トレーニング不要な忘却手法を開発すること。
  • 忘れられたサンプルに特化したパラメータのみを特定し、選択的に修正することで、一般化性能への影響を最小限に抑えること。
  • 完全な再トレーニングに伴う保存および計算コストを回避しつつ、再トレーニングに基づく手法と同等の効率(速度)と性能を達成すること。

提案手法

  • SSDは、忘れられたデータおよび保持されたデータの両方のFisher情報行列(FIM)の対角成分を計算し、パラメータの重要度を定量化する。
  • 忘れられたデータに対して顕著に重要度が高いが、保持データに対してはそれほど重要でないパラメータを同定し、それが特定化(specialization)を示していると判断する。
  • これらの特定化されたパラメータは、忘れられたデータに対する相対的重要性に比例して減衰され、ハイパーパrameter α と λ によって制御される減衰係数を用いる。
  • 本手法は後処理型であり、FIMを計算するための学習データへの単一回のアクセスを必要とし、以降はデータを破棄可能である。
  • 過剰にパラメータ化されたモデルは学習データを記憶する傾向があるため、記憶されたパラメータに焦点を当てることで、選択的かつ効果的な忘却が可能になる。
  • 減衰処理は、モデルの整合性および保持データに対する一般化性能を維持するため、パラメータの小さなサブセットにのみ適用される。

実験結果

リサーチクエスチョン

  • RQ1再トレーニング不要な忘却手法は、再トレーニングに基づく最先端手法と同等の性能を達成できるか?
  • RQ2Fisher情報に基づく選択的パラメータ減衰は、保持データにおけるモデル性能を劣化させることなく、効果的な忘却を実現できるか?
  • RQ3FIM計算後、元の学習データを保存せずとも、高速な忘却が可能か?
  • RQ4異なる忘却シナリオにおいて、SSDの性能は、既存の再トレーニング不要および再トレーニングベースの忘却手法と比べてどうか?
  • RQ5ハイパーパrameter(α と λ)の選択が、繰り返しの忘却リクエストにおける忘却効果およびモデル劣化に与える影響は何か?

主な発見

  • CIFAR100において、SSDはベースラインのResNetの93%およびViTの94%であったメンバーシップ推定攻撃(MIA)の正確度を約2%まで低下させ、完全な再トレーニングと同等の性能を達成した。
  • ResNetでは、忘却処理後、保持データセット(Dr)の精度がわずかに2%低下したが、ViTではわずかな改善が見られ、性能の維持が顕著に確認された。
  • SSDは、先行する再トレーニング不要手法Fisher Forgettingに比べ、速度で数個のオーダー以上に優れており、かつより優れた忘却性能を達成した。
  • CIFAR20におけるサブクラス忘却において、SSDはMIAおよびDr性能において再トレーニングモデルと同等の結果を示したが、Amnesiac や Bad Teacher といった手法は、MIAスコアが不自然に低く出力された。
  • CIFAR10におけるランダムサンプル忘却において、SSDはResNetおよびViTの両方で、速度および有効性の面で再トレーニング性能を完全に再現した。
  • すべてのベンチマークにおいて、完全に再トレーニングされたモデルとの類似度の観点から、SSDは平均的に最も優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。