Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Unlearning

Lucas Bourtoule, Varun Chandrasekaran|arXiv (Cornell University)|2019. 12. 09.
Privacy-Preserving Technologies in Data참고 문헌 55인용 수 8
한 줄 요약

이 논문은 상태 기반 알고리즘인 확률적 경사 하강법과 같은 알고리즘을 위해 데이터 포인트의 영향을 전략적으로 제한함으로써 모델 훈련 중에 기계적 기억 해제를 가속화하는 SISA 훈련 프레임워크를 소개한다. 재훈련에서부터 다시 시작하는 것과 비교해도 최악의 기억 해제 요청 분포 상황에서도 최대 4.63배 빠른 기억 해제 시간을 달성하면서 모델 정확도를 유지한다.

ABSTRACT

Once users have shared their data online, it is generally difficult for them to revoke access and ask for the data to be deleted. Machine learning (ML) exacerbates this problem because any model trained with said data may have memorized it, putting users at risk of a successful privacy attack exposing their information. Yet, having models unlearn is notoriously difficult. We introduce SISA training, a framework that expedites the unlearning process by strategically limiting the influence of a data point in the training procedure. While our framework is applicable to any learning algorithm, it is designed to achieve the largest improvements for stateful algorithms like stochastic gradient descent for deep neural networks. SISA training reduces the computational overhead associated with unlearning, even in the worst-case setting where unlearning requests are made uniformly across the training set. In some cases, the service provider may have a prior on the distribution of unlearning requests that will be issued by users. We may take this prior into account to partition and order data accordingly, and further decrease overhead from unlearning. Our evaluation spans several datasets from different domains, with corresponding motivations for unlearning. Under no distributional assumptions, for simple learning tasks, we observe that SISA training improves time to unlearn points from the Purchase dataset by 4.63x, and 2.45x for the SVHN dataset, over retraining from scratch. SISA training also provides a speed-up of 1.36x in retraining for complex learning tasks such as ImageNet classification; aided by transfer learning, this results in a small degradation in accuracy. Our work contributes to practical data governance in machine unlearning.

연구 동기 및 목표

  • 훈련된 기계 학습 모델에서 데이터 포인트를 효율적으로 기억에서 삭제하는 데 도전하는 것, 특히 데이터 공유 후 사용자가 삭제를 요청할 경우를 고려하여.
  • 일반적으로 재훈련에서부터 다시 시작하는 것과 비슷한 비용이 들기 때문에 기억 해제의 계산적 오버헤드를 줄이는 것.
  • 특히 확률적 경사 하강법을 사용하는 딥 네URAL 네트워크를 위해 성능 저하 없이 더 빠른 기억 해제를 가능하게 하는 훈련 프레임워크를 설계하는 것.
  • 기억 해제 요청 분포에 대한 사전 지식을 활용하여 데이터 분할 및 순서를 최적화하여 기억 해제 비용을 추가로 줄이는 것.
  • 기억 해제를 확장 가능하고 효율적으로 만들음으로써 실생활 기계 학습 구현 환경에서 실용적인 데이터 거버넌스를 가능하게 하는 것.

제안 방법

  • SISA 훈련은 모델 훈련 중 개별 데이터 포인트의 영향을 제한하는 메커니즘을 도입하여 모델 내에서의 기억 획득을 줄인다.
  • 이 프레임워크는 어떤 학습 알고리즘과도 호환되도록 설계되었지만, 확률적 경사 하강법과 같은 상태 기반 알고리즘에서 최적의 성능을 발휘한다.
  • 기억 해제 요청의 사전 분포를 기반으로 훈련 데이터를 분할하고 순서를 정하여 기억 해제 오버헤드를 최소화한다.
  • 초기 훈련 중 영향력 제어를 통해 전체 재훈련이 필요로 하는 경우를 줄여 데이터 포인트를 효율적으로 제거할 수 있도록 한다.
  • 복잡한 작업에서 전이 학습을 활용하여 정확도를 유지하면서도 기억 해제 속도를 높인다.
  • 요청이 훈련 세트 전반에 균일하게 분포되어 있을 경우에도 기억 해제를 효율적으로 수행할 수 있도록 보장한다.

실험 결과

연구 질문

  • RQ1모델을 다시 처음부터 훈련하지 않고 기계적 기억 해제를 어떻게 가속화할 수 있는가?
  • RQ2상태 기반 학습 알고리즘에서 데이터 포인트의 기억 해제 비용을 줄이기 위해 훈련 시점에 어떤 수정을 가할 수 있는가?
  • RQ3기억 해제 요청 분포에 대한 사전 지식을 활용하여 기억 해제 오버헤드를 추가로 줄일 수 있는가?
  • RQ4SISA 훈련은 단순한 작업부터 복잡한 작업에 이르기까지 다양한 데이터셋과 학습 작업에서 어떻게 성능을 발휘하는가?
  • RQ5모델 정확도를 유지하면서 기억 해제 효율성을 얼마나 향상시킬 수 있는가?

주요 결과

  • Purchase 데이터셋에 대해 SISA 훈련은 재훈련에서부터 다시 시작하는 것과 비교해도 분포 가정 없이도 기억 해제 시간을 4.63배 빠르게 한다.
  • SVHN 데이터셋에 대해 SISA 훈련은 재훈련 대비 기억 해제 시간을 2.45배 빠르게 한다.
  • ImageNet 분류와 같은 복잡한 작업에서는 SISA가 재훈련 시간을 1.36배 빠르게 하며, 전이 학습을 활용할 경우 정확도 저하가 미미하다.
  • 기억 해제 요청이 훈련 세트 전반에 균일하게 분포되어 있는 최악의 상황에서도 이 프레임워크는 효과성을 유지한다.
  • 요청 분포에 대한 사전 지식을 통합함으로써 SISA는 전략적 데이터 분할 및 순서 정렬을 통해 기억 해제 오버헤드를 추가로 줄인다.
  • SISA는 효율적이고 신속한 기억 해제를 가능하게 하여 기계 학습 환경에서 확장 가능하고 실용적인 데이터 거버넌스 솔루션을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.