Skip to main content
QUICK REVIEW

[논문 리뷰] Membership Leakage in Label-Only Exposures

Zheng Li, Shuicheng Yan|arXiv (Cornell University)|2020. 07. 30.
Adversarial Robustness in Machine Learning참고 문헌 65인용 수 15
한 줄 요약

이 논문은 기계 학습 모델에서 예측된 레이블만을 이용하는 의사결정 기반 멤버십 유추 공격을 소개하며, 레이블 전용 노출 상태에서도 여전히 멤버십 정보가 泄露됨을 입증한다. 저자들은 전이 공격과 경계 공격이라는 두 가지 새로운 공격 기법을 제안하며, 일부 경우에서 기존의 점수 기반 방법보다 뛰어난 성능을 보이며, 멤버 샘플이 비멤버 샘플보다 모델의 의사결정 경계에서 통계적으로 더 멀리 떨어져 있음을 밝혀낸다.

ABSTRACT

Machine learning (ML) has been widely adopted in various privacy-critical applications, e.g., face recognition and medical image analysis. However, recent research has shown that ML models are vulnerable to attacks against their training data. Membership inference is one major attack in this domain: Given a data sample and model, an adversary aims to determine whether the sample is part of the model's training set. Existing membership inference attacks leverage the confidence scores returned by the model as their inputs (score-based attacks). However, these attacks can be easily mitigated if the model only exposes the predicted label, i.e., the final model decision. In this paper, we propose decision-based membership inference attacks and demonstrate that label-only exposures are also vulnerable to membership leakage. In particular, we develop two types of decision-based attacks, namely transfer attack, and boundary attack. Empirical evaluation shows that our decision-based attacks can achieve remarkable performance, and even outperform the previous score-based attacks in some cases. We further present new insights on the success of membership inference based on quantitative and qualitative analysis, i.e., member samples of a model are more distant to the model's decision boundary than non-member samples. Finally, we evaluate multiple defense mechanisms against our decision-based attacks and show that our two types of attacks can bypass most of these defenses.

연구 동기 및 목표

  • 기계 학습 모델이 신뢰도 점수를 노출하지 않고 레이블만 공개할 경우에도 여전히 멤버십 유추 공격에 취약한가를 조사한다.
  • 기존 연구가 점수 기반 액세스를 전제로 하므로, 레이블 전용 위협 모델 하에서 현실적인 공격을 제안하여 연구 격차를 메운다.
  • 모델의 신뢰도 점수에 접근할 수 없더라도 작동하는 새로운 공격 기법을 개발하여 실제 적용 가능성과 확장성을 높인다.
  • 멤버십 유추 성공의 근본 원인을 분석하며, 의사결정 경계에 대한 데이터의 기하학적 성질에 초점을 맞춘다.
  • 제안된 공격에 대비하여 기존 방어 기법의 효과성을 평가하며, 특히 신뢰도 점수 편향 기반 방어의 성능을 점검한다.

제안 방법

  • 대상 모델과 동일한 분포를 가진 샤로우 데이터셋을 이용해 로컬 샤로우 모델을 훈련하고, 대상 모델의 예측 레이블을 사용해 재레이블링하는 전이 공격을 설계한다.
  • 샤로우 모델에 의사결정 기반 멤버십 유추 분류기를 구축하여, 국소적으로 점수 기반 공격을 수행하며, 이전에 전달된 멤버십 정보를 활용한다.
  • 샤로우 데이터셋이 필요 없이 작동하는 경계 공격을 제안하며, 입력 샘플을 변형하고 모델의 예측을 변경하는 데 필요한 변형의 크기를 측정한다.
  • 변형 크기를 멤버와 비멤버 샘플을 구분하는 대체 지표로 사용하며, 더 큰 변형 크기는 비멤버 샘플을 의미한다.
  • 대상 모델의 아키텍처나 훈련 데이터에 대한 사전 지식이 필요 없는 경계 공격의 일반적인 임계값 선택 방법을 도입한다.
  • 멤버십 상태와 모델의 의사결정 경계로부터의 거리 간의 상관관계를 정량적 및 정성적 분석을 통해 분석한다.

실험 결과

연구 질문

  • RQ1신뢰도 점수에 접근할 수 없고 최종 예측 레이블만 공개될 경우 멤버십 유추 공격이 효과적으로 작동할 수 있는가?
  • RQ2기계 학습 모델에서 멤버십 상태와 관련된 데이터 샘플의 기하학적 또는 통계적 성질은 무엇인가?
  • RQ3기존의 점수 기반 멤버십 유추 공격에 비해 의사결정 기반 공격의 성능은 어떻게 비교되는가?
  • RQ4기존 방어 기법, 특히 신뢰도 점수 편향 기반 방어는 의사결정 기반 멤버십 유추 공격에 얼마나 효과적인가?
  • RQ5제안된 공격은 차별적 프라이버시 및 정규화 기법과 같은 최첨단 방어 기법을 우회할 수 있는가?

주요 결과

  • 제안된 의사결정 기반 공격은 뛰어난 성능을 보이며, 일부 모델 및 데이터셋 설정에서는 기존 점수 기반 공격을 능가하는 경계 공격이 성과를 내었다.
  • 멤버 샘플은 비멤버 샘플보다 항상 모델의 의사결정 경계에서 더 멀리 떨어져 있음이 확인되어, 멤버십 유추 성공에 대한 새로운 기하학적 설명을 제공한다.
  • 전이 공격는 레이블 쿼리만을 사용하여 대상 모델의 멤버십 정보를 로컬 샤로우 모델로 성공적으로 전이하였다.
  • 경계 공격는 샤로우 데이터셋이 없거나 대상 모델에 대한 사전 지식이 없더라도 효과적으로 작동하며, 오직 변형 크기만을 기반으로 멤버십을 추론한다.
  • 신뢰도 점수 편향 기반 방어 기법(예: MemGuard)은 레이블 전용 환경에서는 효과가 없으며, 노출되지 않는 점수를 수정하는 데 의존하기 때문이다.
  • 강한 정규화 및 일반화 향상 방어 기법은 멤버십 누출을 줄이지만 완전히 제거하지 못하며, 이는 레이블 전용 노출이 여전히 심각한 프라이버시 위험임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.