Skip to main content
QUICK REVIEW

[논문 리뷰] Students Parrot Their Teachers: Membership Inference on Model Distillation

Matthew Jagielski, Milad Nasr|arXiv (Cornell University)|2023. 03. 06.
Privacy-Preserving Technologies in Data인용 수 6
한 줄 요약

이 논문은 지식 정련이 멤버십 추론 공격에 대해 제한적인 프라이버시 보호 기능을 제공함을 보여주며, 학생 모델이 정련된 예측을 통해 멤버십 정보를 스며들게 하여 교사 모델의 예측을 '반복'할 수 있음을 시사한다. 이는 관련이 없는 입력에 대해 쿼리가 이루어져도 마찬가지로 성립한다. 저자들은 정련이 교사 및 학생의 훈련 데이터를 충분히 보호하지 못함을 입증하며, 특히 데이터셋이 유사하거나 교사 모델이 오염된 경우 더욱 심각한 문제가 발생함을 밝혔다.

ABSTRACT

Model distillation is frequently proposed as a technique to reduce the privacy leakage of machine learning. These empirical privacy defenses rely on the intuition that distilled ``student'' models protect the privacy of training data, as they only interact with this data indirectly through a ``teacher'' model. In this work, we design membership inference attacks to systematically study the privacy provided by knowledge distillation to both the teacher and student training sets. Our new attacks show that distillation alone provides only limited privacy across a number of domains. We explain the success of our attacks on distillation by showing that membership inference attacks on a private dataset can succeed even if the target model is *never* queried on any actual training points, but only on inputs whose predictions are highly influenced by training data. Finally, we show that our attacks are strongest when student and teacher sets are similar, or when the attacker can poison the teacher set.

연구 동기 및 목표

  • 모델 정련의 실증적 프라이버시 보장을 멤버십 추론 공격에 대해 평가하는 것.
  • 정련이 교사 및 학생 훈련 데이터 양측을 멤버십 추론 공격으로부터 효과적으로 보호하는지 조사하는 것.
  • 정련 과정을 통해 교사 모델의 멤버십 정보가 학생 모델로 어떻게 泄露되는지 이해하는 것.
  • 데이터셋 유사도, 온도 하이퍼파라미터, 데이터 오염이 프라이버시 泄露에 미치는 영향을 평가하는 것.
  • 정련이 학생 데이터나 자기 정련 설정에서 프라이버시를 향상시키는지 탐색하는 것.

제안 방법

  • 최신 기술인 가능도 비율 공격(Likelihood Ratio Attack, LiRA)을 정련 환경에 맞게 수정하여 멤버십 추론에 적용하였다.
  • 세 가지 위협 모델에서 공격 성능을 평가하였다: 알려진 교사, 알려지지 않은 교사, 그리고 대체 모델(적대자가 자체적으로 교사 모델을 훈련함).
  • 멤버십 점수를 校정하기 위해 영향력 있는 모델을 사용하였으며, 이는 타겟 모델과 동일한 정련 파이프라인을 사용해 훈련되었다.
  • CIFAR-10에서 공격 성능을 True Positive Rate(TPR)와 False Positive Rate(FPR)로 측정하였다.
  • 손실 가중치(α)를 변화시켜 정련 손실과 표준 교차 엔트로피 손실 간의 균형을 조절함으로써 자기 정련을 탐색하였다.
  • 예시 간 프라이버시 泄露를 분석하기 위해 훈련 데이터에 영향을 받는 비대상 입력에 대한 예측을 분석하였다.

실험 결과

연구 질문

  • RQ1학생 모델이 해당 예시에 대해 쿼리가 이루어지지 않더라도, 교사의 훈련 데이터에 속하는 예시를 멤버십 추론 공격으로 성공적으로 식별할 수 있는가?
  • RQ2교사 및 학생 훈련 데이터셋 간 유사도가 멤버십 추론 공격의 성공에 어떤 영향을 미치는가?
  • RQ3교사 데이터셋이 오염된 경우, 정련된 모델에서 프라이버시 泄露가 얼마나 악화되는가?
  • RQ4지식 정련이 학생의 훈련 데이터에 대해 의미 있는 프라이버시 보호를 제공하는가?
  • RQ5자기 정련은 특히 학생과 교사 모델이 동일한 경우 프라이버시에 어떤 영향을 미치는가?

주요 결과

  • 정련은 제한적인 프라이버시 보호 기능만 제공하며, 간접적 쿼리를 통해 교사 훈련 데이터에 대해 최대 73%의 정확도로 멤버십 추론 공격가 성공한다.
  • 멤버십 정보는 관련 없는 입력에 대한 예측을 통해 유추될 수 있다. 특히 시각적 특징이 유사한 입력(예: 빨간 톤)은 교사의 훈련 데이터로 인해 혼동을 일으켜 정보 유출을 유도한다.
  • 교사 및 학생 데이터셋 간 유사도가 높거나 교사 데이터셋이 오염된 경우 공격 성공률이 가장 높아지며, 이는 프라이버시 위험을 증가시킨다.
  • 가장 약한 위협 모델인 대체 모델에서도 TPR 10⁻², FPR 10⁻³ 수준의 공격 성능를 기록하여, 제한된 적대자 지식으로도 강력한 공격 가능성을 보여준다.
  • 정련은 학생 훈련 데이터에 대해 거의 또는 전혀 프라이버시 보호를 제공하지 않으며, 자기 정련도 프라이버시 위험을 크게 줄이지 못한다.
  • 정련 과정에서 온도 하이퍼파라미터가 높을수록 프라이버시 유출이 증가하며, 정련 손실에 더 중점을 두는 경우(α > 0.5) 공격 성능이 더욱 높아진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.