Skip to main content
QUICK REVIEW

[論文レビュー] Machine Unlearning

Lucas Bourtoule, Varun Chandrasekaran|arXiv (Cornell University)|Dec 9, 2019
Privacy-Preserving Technologies in Data参考文献 55被引用数 8
ひとこと要約

本論文では、特に確率的勾配降下法のような状態保持型アルゴリズムにおいて、モデル学習中にデータポイントの影響を戦略的に制限することで、機械的アンラーニングの速度を向上させるSISAトレーニングというフレームワークを提案する。再訓練から再び開始する場合と比較して、最悪のアンラーニングリクエスト分布下でも、アンラーニング時間の短縮が最大4.63倍に達し、モデルの精度を維持したままである。

ABSTRACT

Once users have shared their data online, it is generally difficult for them to revoke access and ask for the data to be deleted. Machine learning (ML) exacerbates this problem because any model trained with said data may have memorized it, putting users at risk of a successful privacy attack exposing their information. Yet, having models unlearn is notoriously difficult. We introduce SISA training, a framework that expedites the unlearning process by strategically limiting the influence of a data point in the training procedure. While our framework is applicable to any learning algorithm, it is designed to achieve the largest improvements for stateful algorithms like stochastic gradient descent for deep neural networks. SISA training reduces the computational overhead associated with unlearning, even in the worst-case setting where unlearning requests are made uniformly across the training set. In some cases, the service provider may have a prior on the distribution of unlearning requests that will be issued by users. We may take this prior into account to partition and order data accordingly, and further decrease overhead from unlearning. Our evaluation spans several datasets from different domains, with corresponding motivations for unlearning. Under no distributional assumptions, for simple learning tasks, we observe that SISA training improves time to unlearn points from the Purchase dataset by 4.63x, and 2.45x for the SVHN dataset, over retraining from scratch. SISA training also provides a speed-up of 1.36x in retraining for complex learning tasks such as ImageNet classification; aided by transfer learning, this results in a small degradation in accuracy. Our work contributes to practical data governance in machine unlearning.

研究の動機と目的

  • 訓練済みの機械学習モデルからデータポイントを効率的にアンラーニングする課題に取り組むこと、特にデータ共有後にユーザーが削除を要請する場合を想定する。
  • 通常、再訓練から再び開始するのと同等のコストがかかるアンラーニングの計算負荷を低減すること。
  • 特に確率的勾配降下法を用いる深層ニューラルネットワークにおいて、モデルパフォーマンスを損なわずに、より高速なアンラーニングを可能にするトレーニングフレームワークを設計すること。
  • アンラーニングリクエストの分布に関する事前知識を活用し、データのパーティショニングと順序を最適化することで、アンラーニングコストをさらに低減すること。
  • アンラーニングのスケーラビリティと効率性を高めることで、実世界の機械学習デプロイメントにおける実用的なデータガバナンスを実現すること。

提案手法

  • SISAトレーニングは、モデル学習中に個々のデータポイントの影響を制限するメカニズムを導入し、モデル内でのそれらの記憶を減らす。
  • このフレームワークはあらゆる学習アルゴリズムと互換性を持つが、特に確率的勾配降下法のような状態保持型アルゴリズムで最適な効果を発揮する。
  • アンラーニングリクエストの事前分布に基づいて、トレーニングデータをパーティショニングおよび順序付けすることで、アンラーニングのオーバーヘッドを最小限に抑える。
  • 初期トレーニング段階での影響力制御により、全再訓練の必要性を低減し、効率的なデータポイントの削除を可能にする。
  • 複雑なタスクにおいては、トランスファーラーニングを活用することで、精度を維持しながらアンラーニングを高速化する。
  • リクエストがトレーニングセット全体に均等に分布している最悪の状況でも、アンラーニングが効率的に行えることを保証する。

実験結果

リサーチクエスチョン

  • RQ1再訓練から再び開始するのではなく、モデル全体を再トレーニングせずに、どのようにして機械的アンラーニングを高速化できるか?
  • RQ2状態保持型学習アルゴリズムにおいて、アンラーニングの計算コストを低減するためのトレーニング時の修正は何か?
  • RQ3アンラーニングリクエストの分布に関する事前知識を活用することで、さらにアンラーニングのオーバーヘッドを低減できるか?
  • RQ4SISAトレーニングは、単純なタスクから複雑なタスクまで、多様なデータセットと学習タスクにおいてどのように性能を発揮するか?
  • RQ5モデルの精度を維持したまま、どの程度までアンラーニングの効率を向上させられるか?

主な発見

  • 購入データセットでは、分布に関する仮定なしに、SISAトレーニングにより再訓練から再び開始する場合と比較して、アンラーニング時間が最大4.63倍短縮された。
  • SVHNデータセットでは、SISAトレーニングにより再訓練と比較して、アンラーニング時間が2.45倍速くなった。
  • ImageNet分類のような複雑なタスクでは、SISAは再訓練の速度を1.36倍に向上させたが、トランスファーラーニングを活用することで、わずかな精度の低下しか生じなかった。
  • アンラーニングリクエストがトレーニングセット全体に均等に分布している最悪のシナリオでも、このフレームワークは効果を発揮した。
  • リクエスト分布に関する事前知識を活用することで、SISAは戦略的なデータパーティショニングと順序付けにより、さらにアンラーニングのオーバーヘッドを低減した。
  • SISAは、効率的かつタイムリーなアンラーニングを可能にするスケーラブルで実用的なソリューションを提供し、機械学習におけるデータガバナンスを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。