Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Unlearning: Linear Filtration for Logit-based Classifiers

Thomas Baumhauer, Pascal Schöttle|arXiv (Cornell University)|2020. 02. 07.
Adversarial Robustness in Machine Learning인용 수 12
한 줄 요약

이 논문은 로짓 기반 분류기에서 전체 학습 데이터 클래스를 삭제하는 데 있어 계산적으로 효율적인 머신 언러닝 방법인 선형 필터링을 제안한다. 모델 로짓에 선형 변환(특히 정규화 또는 투영)을 적용함으로써 재학습 없이도 기억을 감소시켜, 실험을 통해 CIFAR-10과 MNIST에서 단순 삭제 대비 모델 역공학 공격에 훨씬 더 강한 저항성을 확보한다.

ABSTRACT

Recently enacted legislation grants individuals certain rights to decide in what fashion their personal data may be used, and in particular a "right to be forgotten". This poses a challenge to machine learning: how to proceed when an individual retracts permission to use data which has been part of the training process of a model? From this question emerges the field of machine unlearning, which could be broadly described as the investigation of how to "delete training data from models". Our work complements this direction of research for the specific setting of class-wide deletion requests for classification models (e.g. deep neural networks). As a first step, we propose linear filtration as a intuitive, computationally efficient sanitization method. Our experiments demonstrate benefits in an adversarial setting over naive deletion schemes.

연구 동기 및 목표

  • 법적 의무(예: '잊혀질 권리')에 따라 기계 학습 모델에서 전체 클래스의 학습 데이터를 효율적으로 삭제하는 도전 과제를 해결한다.
  • 재학습 없이도 모델의 유용성을 유지하면서도 실용적이고 저비용인 언러닝 방법을 개발한다.
  • 특히 모델 역공학 공격을 중심으로 한 적대적 프라이버시 공격을 통해 언러닝 효과를 평가하여 실제 세계의 프라이버시 보장을 평가한다.
  • 실제 배포에 더 현실적인, 약화된 블랙박스 정의의 언러닝을 제안한다.
  • 단순하고 해석 가능한 로짓에 대한 변환을 통해 언러닝을 달성함으로써, 기존 모델 아키텍처의 변경 없이 통합이 가능하다.

제안 방법

  • 추론 후 분류기의 로짓에 선형 변환(예: 정규화 또는 투영)을 적용하는 정제 방법으로 선형 필터링을 제안한다.
  • 필터링 연산이 최종 레이어에 통합될 수 있는 가설 클래스를 사용하여, 재학습 없이도 원활한 통합을 가능하게 한다.
  • 변환을 계산하기 위해 각 클래스당 소수의 대표 데이터 포인트만을 사용하여 계산 오버헤드를 최소화한다.
  • 변환 유형에 따라 단위 구면에의 투영 또는 단위 노름 정규화로 정의한다(예: 정규화 기반 또는 투영 기반 필터링).
  • 모델 추론 후 후처리 단계에서 적용하여, 모델 출력에 대해 블랙박스 방식으로 작동함을 보장한다.
  • 프라이버시 泄露 및 언러닝 후 모델 성능 평가를 위해 Kiefer-Wolfowitz 통계량(KSΦ)과 분류기 우위 지표를 사용한다.

실험 결과

연구 질문

  • RQ1로짓 기반 분류기에서 전체 클래스의 데이터를 재학습 없이 계산적으로 효율적인 후행 처리 방법으로 언러닝할 수 있는가?
  • RQ2선형 필터링은 단순 삭제 대비 기억 감소 및 모델 역공학 공격 방지에 얼마나 효과적인가?
  • RQ3출력 분포 유사성에 기반한 블랙박스 정의의 언러닝은 실제 적용에 실현 가능하고 실용적인 평가 기준이 될 수 있는가?
  • RQ4언러닝 연산은 모델의 최종 레이어에 통합될 수 있는가? 이를 통해 아키텍처 변경 없이 배포가 가능한가?
  • RQ5다양한 데이터셋에서 필터링 유형(예: 정규화 대비 투영)의 선택이 프라이버시 및 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 선형 필터링은 모델 역공학 공격 성공률을 크게 감소시킨다: CIFAR-10에서 언러닝 후 재구성 품질은 원본에 가까운 수준(KSΦ ≈ 0.115)에서 기준 수준에 가까운 수준(KSΦ ≈ 0.038)으로 떨어진다.
  • 정규화 기반 선형 필터링은 적대적 환경에서 단순 삭제보다 우수하며, CIFAR-10에서 KSΦ가 67% 감소하고, MNIST에서는 45% 감소한다.
  • 모델 유용성은 유지되며, 분류기 우위 지표가 언러닝 후에도 안정적으로 유지되어 예측 성능 저하가 없음을 나타낸다.
  • 제안된 블랙박스 언러닝 정의는 프라이버시 보존 방법 평가에 효과적이며, 특히 적대적 테스트와 조합할 경우 유용하다.
  • 정규화 필터링은 CIFAR-10에서 KSΦ = 0.038, MNIST에서 KSΦ = 0.10을 기록하여 단순 삭제(KSΦ = 0.115 및 0.184)를 초월하며, 나머지 클래스에 대한 기준 성능를 유지한다.
  • 이 방법은 계산적으로 경량이며, 각 클래스당 몇 개의 대표 데이터 포인트만으로도 변환을 계산할 수 있어 실세계 배포에 스케일이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.