Skip to main content
QUICK REVIEW

[논문 리뷰] Fair Learning with Private Demographic Data

Hussein Mozannar, Mesrob I. Ohannessian|arXiv (Cornell University)|2020. 02. 26.
Privacy-Preserving Technologies in Data참고 문헌 31인용 수 19
한 줄 요약

이 논문은 국소적 미분적 비밀유지(LDP)를 사용하여 민감한 인적 특성을 학습함으로써 비차별적인 예측 모델을 개발하는 프레임워크를 제안한다. 이는 민감한 정보를暴露하지 않으면서도 비차별적인 모델을 가능하게 한다. 이는 예측 오차와 공정성에 대한 이론적 보장을 보장하는 이중 단계 학습 알고리즘을 도입하여, 약한 조건 하에 원본 특성과 비공식화된 특성 간의 비차별성 동치를 달성한다.

ABSTRACT

Sensitive attributes such as race are rarely available to learners in real world settings as their collection is often restricted by laws and regulations. We give a scheme that allows individuals to release their sensitive information privately while still allowing any downstream entity to learn non-discriminatory predictors. We show how to adapt non-discriminatory learners to work with privatized protected attributes giving theoretical guarantees on performance. Finally, we highlight how the methodology could apply to learning fair predictors in settings where protected attributes are only available for a subset of the data.

연구 동기 및 목표

  • 법적 및 프라이버시 제약 조건 하에서 비차별적인 기계학습을 보장하고 민감한 인구통계적 데이터를 보호하는 데 갈등을 해결하기 위해.
  • 하위 학습자가 보호된 속성의 국소적 비공식화된 버전만을 사용하여 공정한 예측 모델을 훈련시킬 수 있는 방법을 개발하기 위해.
  • 비공식화된 속성에 대한 공정성이 원본 민감한 속성에 대한 공정성으로 이어지는 이론적 조건을 설정하기 위해.
  • 보호된 속성이 부분적으로만 이용 가능한 경우에도 오차와 차별성에 대한 통계적 보장을 갖춘 이중 단계 학습 알고리즘을 제공하기 위해.

제안 방법

  • 이 방법은 민감한 속성을 비공식화함으로써 개인 수준의 프라이버시를 보장하면서도 공정성 학습에 필요한 유용성을 유지하기 위해 국소적 미분적 비밀유지를 사용한다.
  • 비공식화된 속성 $ Z $ 뿐만을 사용하여 차별성을 측정하는 추정기들을 도입함으로써, 원본 $ A $ 를 접근할 수 없더라도 공정성 감사가 가능해진다.
  • 핵심 알고리즘은 $ Z $ 의 통계를 역으로 풀어 원본 $ A $ 의 특성을 복구함으로써, 비공식화된 데이터에서 비차별적인 예측 모델을 구축할 수 있도록 한다.
  • 이중 단계 학습 절차를 사용한다: 첫 번째 단계에서는 비공식화된 데이터에서 기본 예측 모델을 훈련하고, 두 번째 단계에서는 오차를 최소화하면서 공정성 제약 조건을 강제하는 유도된 예측 모델을 최적화한다.
  • 이론적 분석은 경험 과정 이론과 라데마처 복잡도를 기반으로 오차와 차별성을 유한하게 제한하며, 높은 확률 보장을 제공한다.
  • 보호된 속성이 데이터의 일부에만 존재하는 설정으로도 프레임워크를 확장하며, 통계적 보장을 갖춘 감사 알고리즘을 사용한다.

실험 결과

연구 질문

  • RQ1국소적 비공식화된 속성 $ Z $ 에 대해 비차별성이 원본 민감한 속성 $ A $ 에 대해 비차별성과 동치가 되는 조건은 무엇인가?
  • RQ2비공식화된 인구통계적 데이터만을 사용할 수 있을 때, 낮은 오차와 낮은 차별성을 동시에 달성할 수 있는 학습 알고리즘을 설계할 수 있는가? 이에 대한 이론적 보장이 존재하는가?
  • RQ3프라이버시 수준과 가설 클래스의 복잡도가 비공식화된 공정한 학습에서 공정성과 오차의 상호 보완 관계에 어떻게 영향을 미치는가?
  • RQ4보호된 속성이 누락되거나 훈련 데이터의 일부에만 존재하는 경우에도 제안된 방법이 어떻게 처리할 수 있는가?
  • RQ5유도된 예측 모델의 통계적 성능은 최적의 공정한 예측 모델 대비 오차와 차별성 측면에서 어떻게 되는가?

주요 결과

  • 논문은 비공식화된 속성 $ Z $ 에 대한 공정성이 원본 속성 $ A $ 에 대한 공정성으로 이어지는 충분한 조건를 설정하여, 프라이버시를 보장하는 공정성 실현을 가능하게 한다.
  • 유도된 예측 모델 $ \widetilde{Y} $ 는 높은 확률로 오차 한계 $ \mathrm{err}(\widetilde{Y}) \leq_{\delta} \mathrm{err}(Y^{*}) + \frac{5C}{\min_{ya}\mathbf{P}_{ya}^{2}}\left(\frac{2}{B} + 10\mathfrak{R}_{\frac{\min_{ya}n\mathbf{P}_{ya}}{4}}(\mathcal{H}) + 18|\mathcal{A}|\sqrt{\frac{2\log{64|\mathcal{A}|/\delta}}{n\min_{ya}\mathbf{P}_{ya}}}\right) $ 를 확보한다.
  • 차별성은 $ \mathrm{disc}(\widetilde{Y}) \leq_{\delta} \sqrt{\frac{\log(64/\delta)}{2n}} \cdot \frac{8|\mathcal{A}|C^{2}}{\min_{ya}\mathbf{P}_{ya}^{2}} $ 로 제한되며, 이는 표본 크기가 클수록 및 비공식화된 속성의 분산이 낮을수록 공정성이 향상됨을 보여준다.
  • 이 방법은 $ A $ 와 $ Z $ 간의 비차별성 동치를 달성하여 프록시 기반 공정성 접근법이 편향을 과소평가할 수 있는 문제를 피한다.
  • 보호된 속성이 데이터의 일부에만 존재할 경우, 감사 알고리즘이 통계적 보장을 제공하여, 부족한 인구통계 정보가 존재하더라도 편향을 탐지할 수 있다.
  • 이론적 분석은 이중 단계 알고리즘이 최적의 공정한 예측 모델과 유사한 공정성과 오차 성능을 유지함을 확인하며, 이는 가설 클래스의 복잡도와 데이터 분포에 따라 달라지는 경계에 의존한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.