Skip to main content
QUICK REVIEW

[논문 리뷰] Reconstruction Attacks on Machine Unlearning: Simple Models are Vulnerable

Martín Bertrán, Shuai Tang|arXiv (Cornell University)|2024. 05. 30.
Robotic Process Automation Applications인용 수 4
한 줄 요약

이 논문은 단순한 모델—특히 선형 회귀 및 임베딩을 갖춘 선형 모델—에서의 머신 언러닝이 데이터를 근접한 완벽한 복원 공격에 취약하게 만든다는 것을 보여준다. 저자들은 삭제 전후 모델 파라미터의 차이를 이용하여 공격자가 삭제된 데이터 포인트를 높은 정밀도로 복원할 수 있음을 입증한다. 이는 모델이 개인정보 泄露 에 대해 본질적으로 낮은 위험을 지닌 경우에도 해당한다.

ABSTRACT

Machine unlearning is motivated by desire for data autonomy: a person can request to have their data's influence removed from deployed models, and those models should be updated as if they were retrained without the person's data. We show that, counter-intuitively, these updates expose individuals to high-accuracy reconstruction attacks which allow the attacker to recover their data in its entirety, even when the original models are so simple that privacy risk might not otherwise have been a concern. We show how to mount a near-perfect attack on the deleted data point from linear regression models. We then generalize our attack to other loss functions and architectures, and empirically demonstrate the effectiveness of our attacks across a wide range of datasets (capturing both tabular and image data). Our work highlights that privacy risk is significant even for extremely simple model classes when individuals can request deletion of their data from the model.

연구 동기 및 목표

  • 단순한 모델에서의 머신 언러닝이 표준 훈련에서 관찰되지 않는 새로운 개인정보 유출 위험을 초래하는지 조사하는 것.
  • 모델에서 데이터를 삭제하는 행위가 삭제된 데이터 포인트에 대한 정보를 간접적으로 泄露 할 수 있는지 분석하는 것.
  • 삭제 전후 모델 파라미터의 차이를 활용하여 실용적인 복원 공격를 개발하는 것.
  • 이차 근사법을 사용하여 고정 임베딩과 비선형 목표 함수를 갖는 모델로 공격를 확장하는 것.
  • 조직화된 복잡도를 지닌 모델—예를 들어 리지 회귀—조차도 언러닝이 적용될 경우 높은 정확도의 복원 공격에 취약하다는 것을 입증하는 것.

제안 방법

  • 선형 회귀에서의 폐쇄형 단일 샘플 업데이트 규칙을 활용하여 삭제 전후 모델 파라미터의 차이를 계산한다.
  • 동일한 분포에서 유래된 별도의 공개 데이터셋에서 훈련 데이터의 공분산 행렬을 추정한다.
  • 선형 모델에서 복원 정확도를 향상시키기 위해 截距 보정 기법을 적용한다.
  • 고정 임베딩을 갖는 모델로 공격를 확장하기 위해 삭제된 샘플의 임베딩을 복원하고, 원래 입력을 복원하기 위한 역문제를 해결한다.
  • 뉴턴 방법을 사용하여 삭제된 샘플의 모델 파라미터에 대한 기울기 근사를 도출함으로써 일반적인 손실 함수에 적용할 수 있도록 한다.
  • 복원 품질을 비교하기 위해 펌프터베이션 기반 기준(MaxDiff)을 사용하여 제안된 방법(HRec)의 우수성을 검증한다.
Figure 1 : We conduct membership inference attacks on a ridge regression on ACS Income task; the attack performance is poor (close to random guessing).
Figure 1 : We conduct membership inference attacks on a ridge regression on ACS Income task; the attack performance is poor (close to random guessing).

실험 결과

연구 질문

  • RQ1공격자가 삭제 전후 모델 파라미터만을 사용하여 삭제된 데이터 포인트를 높은 정확도로 복원할 수 있는가?
  • RQ2개인정보 유출 위험이 전통적으로 낮다고 여겨지는 단순한 모델—예를 들어 선형 회귀—에서도 복원 공격에 대한 취약성이 지속되는가?
  • RQ3고정 임베딩 또는 비선형 목표 함수를 갖는 모델로 공격를 얼마나 일반화할 수 있는가?
  • RQ4진짜 공분산 행렬과 정규화 파라미터가 알려져 있지 않고 추정되어야 할 경우, 공격의 효과는 어느 정도인가?
  • RQ5해석적 단일 샘플 업데이트가 없는 모델에서 이차 근사 언러닝 근사를 통해 복원이 가능할 수 있는가?

주요 결과

  • 진짜 공분산 행렬과 정규화 파라미터가 알려져 있을 경우, 제안된 공격는 선형 회귀 모델에서 삭제된 샘플을 거의 완벽하게 복원한다.
  • 공분산 행렬을 추정하고 $λ = 0$일 경우에도, 원본 특징을 사용하여 ACS 소득 데이터셋에서 거의 완벽한 복원 정확도를 달성한다.
  • 랜덤 푸리에 특징을 사용한 리지 회귀의 경우, 공격는 원본 데이터 포인트를 매우 높은 정밀도로 복원하며, 기존 기준보다 뚜렷하게 뛰어난 성능을 보인다.
  • 로지스틱 회귀와 서포트 벡터 머신(SVM)을 사용한 이진 분류 작업에서는 분석적 단일 샘플 업데이트가 없음에도 불구하고, 복원된 샘플과 원본 샘플 간의 유사도 점수가 매우 높다.
  • 뉴턴 방법을 사용하여 기울기를 근사함으로써 복잡한 손실 함수를 갖는 모델에서도 복원이 가능하며, 이는 메서드의 효과성을 유지함을 보여준다.
  • 시각적 및 정량적 비교에서 HRec은 원본 삭제된 이미지(예: CIFAR-10)와 매우 유사한 복원 결과를 생성하는 반면, MaxDiff는 훨씬 열 劣한 성능을 보인다.
Reconstruction Attacks on Machine Unlearning: Simple Models are Vulnerable

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.