Skip to main content
QUICK REVIEW

[論文レビュー] DeepObliviate: A Powerful Charm for Erasing Data Residual Memory in Deep Neural Networks

Yingzhe He, Guozhu Meng|arXiv (Cornell University)|May 13, 2021
Privacy-Preserving Technologies in Data参考文献 48被引用数 6
ひとこと要約

DeepObliviate は、中間モデルを保存することで、影響を受けるコンponent のみを再訓練する手法を採用し、再訓練から再構築するのと比較して最大 75× の高速化を達成しながら、高い精度を維持し、バックドア検証に合格する、高速で効率的な深層ニューラルネットワークの機械的消去手法を提案する。

ABSTRACT

Machine unlearning has great significance in guaranteeing model security and protecting user privacy. Additionally, many legal provisions clearly stipulate that users have the right to demand model providers to delete their own data from training set, that is, the right to be forgotten. The naive way of unlearning data is to retrain the model without it from scratch, which becomes extremely time and resource consuming at the modern scale of deep neural networks. Other unlearning approaches by refactoring model or training data struggle to gain a balance between overhead and model usability. In this paper, we propose an approach, dubbed as DeepObliviate, to implement machine unlearning efficiently, without modifying the normal training mode. Our approach improves the original training process by storing intermediate models on the hard disk. Given a data point to unlearn, we first quantify its temporal residual memory left in stored models. The influenced models will be retrained and we decide when to terminate the retraining based on the trend of residual memory on-the-fly. Last, we stitch an unlearned model by combining the retrained models and uninfluenced models. We extensively evaluate our approach on five datasets and deep learning models. Compared to the method of retraining from scratch, our approach can achieve 99.0%, 95.0%, 91.9%, 96.7%, 74.1% accuracy rates and 66.7$ imes$, 75.0$ imes$, 33.3$ imes$, 29.4$ imes$, 13.7$ imes$ speedups on the MNIST, SVHN, CIFAR-10, Purchase, and ImageNet datasets, respectively. Compared to the state-of-the-art unlearning approach, we improve 5.8% accuracy, 32.5$ imes$ prediction speedup, and reach a comparable retrain speedup under identical settings on average on these datasets. Additionally, DeepObliviate can also pass the backdoor-based unlearning verification.

研究の動機と目的

  • 特定のデータポイントを消去するために、深層ニューラルネットワークを再訓練する際の高い計算コストを低減すること。
  • GDPR や CCPA などの規制における「忘れられる権利」を尊重する、効率的な機械的消去を実現すること。
  • 再訓練のオーバーヘッドを最小限に抑えながら、高いモデル精度と実用性を維持すること。
  • アーキテクチャの変更なしに、標準的なトレーニングワークフローと互換性を持つ実用的な消去ソリューションを提供すること。
  • バックドアベースのテストを通じて、データの影響が完全に削除されたことを確認する。

提案手法

  • 元のトレーニングプロセス中に定期的に中間モデルを保存し、後続の特定のチェックポイントからの再訓練を可能にする。
  • 時間的残存記憶を測定することで、ターゲットデータポイントの影響を時系列的に評価する。
  • データポイントの影響を最も受けたモデルを同定し、同じトレーニングデータを用いて再訓練するが、ターゲットデータは除外する。
  • リアルタイムで残存記憶の減少トレンドを監視することで、最適な再訓練終了タイミングを特定する。
  • 再訓練されたモデルと影響を受けなかったモデルを統合して、最終的な消去済みモデルを構築する。
  • バックドアトリガーを用いて、消去の成功を検証する。具体的には、消去済みデータに対してモデルが出力するラベルがトリガーに応じないかを確認する。

実験結果

リサーチクエスチョン

  • RQ1全モデルを再訓練せずに、効率的な深層消去を達成できるか?
  • RQ2特定のデータポイントに影響を受けるモデル部品を特定し、その部分のみを効率的に再訓練できるか?
  • RQ3完全な消去を保証するために、再訓練をいつ停止すべきかを効果的かつ効率的に特定する方法は何か?
  • RQ4提案手法は、大幅に短縮された消去時間の下でも高いモデル精度を維持できるか?
  • RQ5消去済みモデルは、バックドアベースのテストなど厳密な検証をパスできるか、データの影響が完全に削除されたことを確認できるか?

主な発見

  • MNIST、SVHN、CIFAR-10、Purchase、ImageNet において、それぞれ 99.0%、95.0%、91.9%、96.7%、74.1% の精度を示し、再訓練から再構築する手法と同等の性能を達成した。
  • MNIST、SVHN、CIFAR-10、Purchase、ImageNet において、それぞれ 66.7×、75.0×、33.3×、29.4×、13.7× の高速化を達成し、全再訓練と比較して大幅な時間短縮を実現した。
  • 最先端の消去手法と比較して、平均で 5.8% の精度向上と 32.5× の予測速度向上を達成した。
  • 同様の設定下で最先端手法と同等の再訓練スピードアップを達成した一方、精度では顕著に優れた性能を示した。
  • バックドアベースの消去検証に成功し、消去済みデータがモデルの予測に影響しなくなったことを確認した。
  • 本手法はモデルに依存せず、標準的なトレーニングパイプラインと互換性があり、元のモデルアーキテクチャやトレーニングプロセスに変更を加える必要がない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。