Skip to main content
QUICK REVIEW

[논문 리뷰] Black-box Model Inversion Attribute Inference Attacks on Classification Models

Shagufta Mehnaz, Ninghui Li|arXiv (Cornell University)|2020. 12. 07.
Privacy-Preserving Technologies in Data참고 문헌 32인용 수 7
한 줄 요약

이 논문은 오라클 액세스를 통해 분류 모델에서 민감한 속성을 추론하기 위해 신규 블랙박스 모델 역공학 공격인 신뢰도 모델 기반(CMMIA) 및 신뢰도 점수 기반(CSMIA) 공격을 제안한다. 이 공격들은 이전 작업을 뛰어넘으며, 특히 비균형 데이터셋에서 뛰어난 성능을 보이며, 특정 민감한 인구집단이 더 취약하다는 점을 드러내며, 비민감한 속성이 알려지지 않은 경우에도 성능이 안정적임을 보인다.

ABSTRACT

Increasing use of ML technologies in privacy-sensitive domains such as medical diagnoses, lifestyle predictions, and business decisions highlights the need to better understand if these ML technologies are introducing leakages of sensitive and proprietary training data. In this paper, we focus on one kind of model inversion attacks, where the adversary knows non-sensitive attributes about instances in the training data and aims to infer the value of a sensitive attribute unknown to the adversary, using oracle access to the target classification model. We devise two novel model inversion attribute inference attacks -- confidence modeling-based attack and confidence score-based attack, and also extend our attack to the case where some of the other (non-sensitive) attributes are unknown to the adversary. Furthermore, while previous work uses accuracy as the metric to evaluate the effectiveness of attribute inference attacks, we find that accuracy is not informative when the sensitive attribute distribution is unbalanced. We identify two metrics that are better for evaluating attribute inference attacks, namely G-mean and Matthews correlation coefficient (MCC). We evaluate our attacks on two types of machine learning models, decision tree and deep neural network, trained with two real datasets. Experimental results show that our newly proposed attacks significantly outperform the state-of-the-art attacks. Moreover, we empirically show that specific groups in the training dataset (grouped by attributes, e.g., gender, race) could be more vulnerable to model inversion attacks. We also demonstrate that our attacks' performances are not impacted significantly when some of the other (non-sensitive) attributes are also unknown to the adversary.

연구 동기 및 목표

  • 민감한 데이터를 기반으로 훈련된 머신러닝 모델에 대한 블랙박스 액세스가 초래하는 프라이버시 위험을 해결하기 위해.
  • 비민감한 속성이 알려져 있거나 일부 알려져 있을 때 민감한 속성을 추론할 수 있는 새로운 모델 역공학 공격을 개발하기 위해.
  • 특히 민감한 속성 분포가 비균형일 경우, 정확도보다 더 효과적인 평가 지표를 식별하기 위해.
  • 데이터 분포 패턴으로 인해 일부 민감한 인구집단이 모델 역공학 공격에 더 취약한지 조사하기 위해.
  • 공격자가 대상 개인의 비민감한 속성에 대한 완전한 지식이 없을 경우 공격의 강건성 평가하기 위해.

제안 방법

  • 대상 모델과 동일한 인구집단의 서rogate 데이터셋을 사용하여 신뢰도 점수를 모델링하고 민감한 속성을 추론하는 신뢰도 모델 기반 공격(CMMIA)을 설계한다.
  • 보조 데이터셋이 필요 없이 레이블과 신뢰도 점수 출력만을 사용하는 신뢰도 점수 기반 공격(CSMIA)을 설계한다.
  • 대상 모델의 신뢰도 점수를 특성-레이블 상관관계의 대체 지표로 사용하여 민감한 속성 값을 재구성한다.
  • 비민감한 속성이 알려진 입력 인스턴스에 대해 대상 모델의 신뢰도 점수를 예측할 수 있는 서rogate 모델을 훈련한다.
  • 신뢰도 점수를 예측된 민감한 속성 값으로 매핑하기 위해 척도 변환 및 임계값 설정 기법을 적용한다.
  • 비균형 데이터에서 정확도보다 더 유의미한 평가 지표인 G-mean과 Matthews 상관계수(MCC)를 사용하여 공격 성능을 평가한다.

실험 결과

연구 질문

  • RQ1오라클 액세스만 제공되는 상황에서 블랙박스 모델 역공학 공격이 민감한 속성을 효과적으로 추론할 수 있는가?
  • RQ2공격자 지식의 가정이 다양할 때 제안된 CMMIA 및 CSMIA 공격이 기존 최신 기술 공격과 비교해 성능가능성은 어떠한가?
  • RQ3민감한 속성이 비균형일 경우, G-mean과 MCC는 정확도보다 attribute inference 공격 평가에 더 유용한가?
  • RQ4특정 민감한 인구집단(예: 성별 또는 교육 수준 기반)이 데이터 분포 패턴으로 인해 모델 역공학 공격에 더 취약한가?
  • RQ5공격자가 대상 개인의 비민감한 속성에 대한 지식을 완전히 확보하지 못할 경우 공격 성능은 어떻게 저하되는가?

주요 결과

  • 제안된 CMMIA 및 CSMIA 공격는 의사결정 트리 및 딥 네트워크 모델 모두에서 기존 최신 기술 공격을 뛰어넘는 민감한 속성 추론 정확도를 확보한다.
  • 특히 민감한 속성이 비균형일 경우, G-mean과 Matthews 상관계수(MCC)는 정확도보다 attribute inference 공격 평가에 더 정보가 풍부하다.
  • 특정 민감한 인구집단(예: 특정 성별 또는 교육 수준 하위집단)은 모델 역공학 공격에 더 취약함을 보이며, 이는 모델 프라이버시 위험의 비균형성 특성을 시사한다.
  • 공격자가 일부 비민감한 속성 지식을 확보하지 못하더라도 공격 성능이 높게 유지되어 부분 정보 상황에서도 강건함을 입증한다.
  • 신뢰도 점수 기반 공격(CSMIA)은 인구집단 수준의 데이터셋이 필요 없어 더 제한된 위협 모델에 적용 가능하다.
  • 연구 결과, 높은 예측 능력을 지닌 모델일수록 attribute inference 공격에 더 취약함을 확인하였으며, 이는 모델 성능과 프라이버시 유출이 밀접하게 연결되어 있음을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.