Skip to main content
QUICK REVIEW

[논문 리뷰] Dikaios: Privacy Auditing of Algorithmic Fairness via Attribute Inference Attacks

Jan Aalmoes, Vasisht Duddu|arXiv (Cornell University)|2022. 02. 04.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

Dikaios는 기계학습에서의 처리 중 공정성 알고리즘의 프라이버시 위험을 평가하기 위해 적응형 임계값 기반 속성 유추 공격을 사용하는 프라이버시 감사 도구이다. 이 도구는 공정성 메커니즘이 특히 클래스 불균형 하에서 예측할 수 없게 속성 泄露를 증가시켜 신뢰할 수 있는 AI 설계를 둔기고 있음을 드러낸다.

ABSTRACT

Machine learning (ML) models have been deployed for high-stakes applications. Due to class imbalance in the sensitive attribute observed in the datasets, ML models are unfair on minority subgroups identified by a sensitive attribute, such as race and sex. In-processing fairness algorithms ensure model predictions are independent of sensitive attribute. Furthermore, ML models are vulnerable to attribute inference attacks where an adversary can identify the values of sensitive attribute by exploiting their distinguishable model predictions. Despite privacy and fairness being important pillars of trustworthy ML, the privacy risk introduced by fairness algorithms with respect to attribute leakage has not been studied. We identify attribute inference attacks as an effective measure for auditing blackbox fairness algorithms to enable model builder to account for privacy and fairness in the model design. We proposed Dikaios, a privacy auditing tool for fairness algorithms for model builders which leveraged a new effective attribute inference attack that account for the class imbalance in sensitive attributes through an adaptive prediction threshold. We evaluated Dikaios to perform a privacy audit of two in-processing fairness algorithms over five datasets. We show that our attribute inference attacks with adaptive prediction threshold significantly outperform prior attacks. We highlighted the limitations of in-processing fairness algorithms to ensure indistinguishable predictions across different values of sensitive attributes. Indeed, the attribute privacy risk of these in-processing fairness schemes is highly variable according to the proportion of the sensitive attributes in the dataset. This unpredictable effect of fairness mechanisms on the attribute privacy risk is an important limitation on their utilization which has to be accounted by the model builder.

연구 동기 및 목표

  • 처리 중 공정성 알고리즘이 속성 프라이버시 泄露에 어떤 영향을 미치는지 이해하는 데 있어 빈도가 낮은 문제를 해결하기 위해.
  • 민감한 속성에서의 클래스 불균형으로 인해 공정성 메커니즘이 간접적으로 프라이버시 위험을 증가시킬 수 있음을 규명하기 위해.
  • 모델 개발자가 공정성 알고리즘의 프라이버시 영향을 평가할 수 있도록 실용적인 감사 도구를 개발하기 위해.
  • 기존의 속성 유추 공격가 실세계 데이터 불균형 조건 하에서 공정성 알고리즘을 평가하는 데 부적절하다는 것을 입증하기 위해.

제안 방법

  • 민감한 속성에서의 클래스 불균형을 고려하기 위해 속성 유추 공격에 적응형 예측 임계값을 제안한다.
  • 모델 예측을 활용하여 민감한 속성을 유추하는 데 사용되는 블랙박스 감사 도구인 Dikaios를 설계한다.
  • 불균형 하에서 모델의 예측 분포와 일치하도록 조정함으로써 정확도를 향상시키는 임계값 적응 전략을 구현한다.
  • 다섯 개인 실세계 데이터셋에서 두 가지 처리 중 공정성 알고리즘에 대해 공격을 평가하여 프라이버시 泄漏를 측정한다.
  • 공정성 알고리즘이 민감한 속성 그룹 간에 구분이 불가능한 예측을 실제로 달성하는지 여부를 공격을 통해 평가한다.
  • 모델 개발 라이프사이클에 프라이버시 감사를 통합하여 프라이버시 인식 공정성 설계를 지원한다.

실험 결과

연구 질문

  • RQ1제안된 적응형 임계값 기반 속성 유추 공격가 클래스 불균형 하에서 공정성 인식 모델의 프라이버시 泄漏를 얼마나 효과적으로 드러내는가?
  • RQ2민감한 속성에서의 클래스 불균형이 처리 중 공정성 알고리즘의 프라이버시 위험에 어느 정도의 영향을 미치는가?
  • RQ3기존의 속성 유추 공격가 블랙박스 모델에서 공정성 메커니즘의 프라이버시 영향을 신뢰성 있게 감사할 수 있는가?
  • RQ4다양한 민감한 속성 분포를 가진 다양한 데이터셋에서 공정성 알고리즘의 프라이버시 위험은 어떻게 변화하는가?
  • RQ5실세계 데이터 조건 하에서 처리 중 공정성 알고리즘이 속성 프라이버시를 유지하는 데 있어 어떤 한계를 지니는가?

주요 결과

  • 적응형 임계값 기반 속성 유추 공격는 클래스 불균형 하에서 기존 공격보다 민감한 속성을 유추하는 데 훨씬 뛰어나다.
  • 처리 중 공정성 알고리즘은 소수자 그룹이 부족할 경우 민감한 속성 그룹 간에 예측이 구분되지 않도록 보장하지 못한다.
  • 공정성 알고리즘에 의해 유도되는 프라이버시 위험은 데이터셋 내 민감한 속성 비율에 따라 매우 다양하고 예측할 수 없다.
  • 모델 개발자는 동일한 알고리즘이 다른 데이터셋에서는 더 많은 민감한 정보를 泄漏할 수 있으므로, 공정성 알고리즘이 속성 프라이버시를 보존한다고 신뢰할 수 없다.
  • 본 연구는 공정성과 프라이버시 사이에 치명적인 상충관계가 있음을 드러내며, 공정성 메커니즘이 소수자 하위 집단에서 의도치 않게 프라이버시 泄漏를 증가시킬 수 있음을 보여준다.
  • Dikaios는 모델 개발자가 공정성 인식 모델을 배포하기 전에 프라이버시 위험을 사전에 탐지하고 완화할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.