Skip to main content
QUICK REVIEW

[논문 리뷰] Enhanced Membership Inference Attacks against Machine Learning Models

Jiayuan Ye, Aadyaa Maddi|arXiv (Cornell University)|2021. 11. 18.
Adversarial Robustness in Machine Learning참고 문헌 45인용 수 13
한 줄 요약

이 논문은 참조 모델을 사용하여 더 강력한 공격을 설계할 수 있도록 통합된 가설 검정 프레임워크를 제안한다. 이 프레임워크는 이전 연구를 통합하고 공격자의 불확실성을 최소화함으로써 더 높은 진성 양성률과 낮은 위양성률을 달성하는 Attack R과 Attack D를 도입한다. CIFAR-10 및 Wide ResNet 모델에서 기존 방법인 LiRA에 비해 정확도와 계산 효율성 측면에서 뛰어난 성능을 보이며, 이는 기존 연구의 불일치성과 비교 불가능성을 해결한다.

ABSTRACT

How much does a machine learning algorithm leak about its training data, and why? Membership inference attacks are used as an auditing tool to quantify this leakage. In this paper, we present a comprehensive extit{hypothesis testing framework} that enables us not only to formally express the prior work in a consistent way, but also to design new membership inference attacks that use reference models to achieve a significantly higher power (true positive rate) for any (false positive rate) error. More importantly, we explain extit{why} different attacks perform differently. We present a template for indistinguishability games, and provide an interpretation of attack success rate across different instances of the game. We discuss various uncertainties of attackers that arise from the formulation of the problem, and show how our approach tries to minimize the attack uncertainty to the one bit secret about the presence or absence of a data point in the training set. We perform a extit{differential analysis} between all types of attacks, explain the gap between them, and show what causes data points to be vulnerable to an attack (as the reasons vary due to different granularities of memorization, from overfitting to conditional memorization). Our auditing framework is openly accessible as part of the extit{Privacy Meter} software tool.

연구 동기 및 목표

  • 공격자의 불확실성에 대한 가정이 상이하여 기존 멤버십 추론 공격가 서로 일관성 없고 비교 불가능한 데 기인한 문제를 해결하기 위해.
  • 멤버십 추론을 통일된 프레임워크로 가설 검정 문제로 공식화하여 공격 성능의 일관된 비교와 해석이 가능하도록 하기 위해.
  • 특히 훈련 세트에 포함된 데이터의 멤버십 여부를 나타내는 비밀 비트를 포함한 공격자 지식 내의 불확실성 원인을 규명하고 이를 최소화하기 위해.
  • 과적합에서 조건부 기억까지 다양한 정도의 누출을 분석하여 다양한 공격이 성공하거나 실패하는 이유를 설명하기 위해.
  • 더 강력하고 효율적인 공격을 설계할 수 있는 체계적 방법론을 개발하고, 기밀성 위험 평가에 실질적인 통찰을 제공하기 위해.

제안 방법

  • 공격자가 모델 출력을 바탕으로 데이터 포인트가 훈련 세트의 멤버인지 여부를 판단해야 하는 불확실성 게임에서 멤버십 추론을 무작위 실험으로 공식화한다.
  • 공격자의 불확실성을 포괄하고 다양한 방법 간의 공격력 비교를 일관되게 가능하게 하는 가설 검정 템플릿을 도입한다.
  • 참조 모델을 사용하여 멤버십 추론의 임계값을 추정함으로써 불확실성을 단 한 비트(포함/미포함)로 최소화하는 Attack R과 Attack D를 설계한다.
  • 차등 분석을 통해 공격의 취약 원인을 비교하고, 과적합, 어려운 예제의 기억, 잠재적 이웃의 영향 등을 포함한 요인을 규명한다.
  • 데이터의 부분집합으로 훈련된 참조 모델을 활용하여 대상 레코드의 조건부 누출을 추정함으로써 정확도를 향상시키고 계산 비용을 절감한다.
  • Privacy Meter 도구에 이 프레임워크를 구현하여 기계학습 모델의 재현 가능하고 감사 가능한 기밀성 위험 평가를 가능하게 한다.

실험 결과

연구 질문

  • RQ1어떻게 멤버십 추론 공격를 일관된 가설 검정 프레임워크 아래 통합하여 공정한 비교와 해석이 가능하게 할 수 있는가?
  • RQ2공격자 지식 내의 불확실성 원인이 멤버십 추론 공격 성능을 제한하는가? 그리고 이러한 원인은 어떻게 최소화할 수 있는가?
  • RQ3다양한 공격이 멤버십을 추론하는 데 성능이 다른 이유는 무엇이며, 과적합, 조건부 기억 등 어떤 종류의 기억이 취약성에 기여하는가?
  • RQ4특정 데이터 레코드의 취약성에 영향을 주는 나머지 훈련 데이터셋의 구성, 특히 잠재적 이웃의 존재는 어떻게 작용하는가?
  • RQ5체계적인 방법론을 통해 LiRA와 같은 최첨단 방법에 비해 정확도와 효율성 측면에서 뛰어난 성능을 내는 공격를 개발할 수 있는가?

주요 결과

  • Attack R은 CIFAR-10 및 Wide ResNet에서 LiRA(Carlini 등, 2022)보다 더 높은 AUC 스코어를 기록했으며, 낮은 위양성률에서 유사한 진성 양성률을 유지한다.
  • Attack D는 고정된 높은 진성 양성률에서 LiRA를 초월하는 AUC 성능과 낮은 위양성률을 달성했으며, 이는 알려지지 않은 대상 데이터셋 영향을 고려한 덕분이다.
  • 제안된 프레임워크는 LiRA가 포인트당 n OUT 및 n IN 모델을 요구하는 데 비해, 단지 2n OUT 모델만 필요로 하여 계산 비용을 크게 절감한다. 이는 k개의 대상 포인트에 대해 약 2/(k+1) 배의 감소된 분할 비용을 제공한다.
  • 차등 분석을 통해 취약성은 과적합, 어려운 예제의 기억, 잠재적 이웃에 의해 영향을 받는 조건부 기억 등 다수의 동시 요인이 원인이 됨을 규명했다.
  • 취약한 레코드의 손실은 해당 레코드가 올바르게 멤버로 예측된 모델에서 크게 낮아지지만, 무작위 레코드의 손실은 예측 정확도와 관계없이 안정적으로 유지된다.
  • 취약한 레코드의 잠재적 이웃은 전체 훈련 데이터셋보다 그 취약성에 더 강한 영향을 미치며, 이는 국소적 데이터 구조가 전반적 데이터 구성보다 더 예측력이 높다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.