Skip to main content
QUICK REVIEW

[논문 리뷰] Holistic Survey of Privacy and Fairness in Machine Learning

Sina Shaham, Arash Hajisafi|arXiv (Cornell University)|2023. 07. 28.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 지도학습, 비지도학습, 준지도학습, 강화학습 전반에 걸쳐 기계학습의 기밀성과 공정성에 대한 종합적이고 통합적인 서베이를 제시한다. 기밀성과 공정성 간의 상호작용을 분석하고, 두 목표를 동시에 최적화하는 기존 아키텍처 및 알고리즘을 검토하며, 기능 손실을 최소화하면서도 특히 대규모 언어 모델에서의 핵심 과제를 규명한다.

ABSTRACT

Privacy and fairness are two crucial pillars of responsible Artificial Intelligence (AI) and trustworthy Machine Learning (ML). Each objective has been independently studied in the literature with the aim of reducing utility loss in achieving them. Despite the significant interest attracted from both academia and industry, there remains an immediate demand for more in-depth research to unravel how these two objectives can be simultaneously integrated into ML models. As opposed to well-accepted trade-offs, i.e., privacy-utility and fairness-utility, the interrelation between privacy and fairness is not well-understood. While some works suggest a trade-off between the two objective functions, there are others that demonstrate the alignment of these functions in certain scenarios. To fill this research gap, we provide a thorough review of privacy and fairness in ML, including supervised, unsupervised, semi-supervised, and reinforcement learning. After examining and consolidating the literature on both objectives, we present a holistic survey on the impact of privacy on fairness, the impact of fairness on privacy, existing architectures, their interaction in application domains, and algorithms that aim to achieve both objectives while minimizing the utility sacrificed. Finally, we identify research challenges in achieving privacy and fairness concurrently in ML, particularly focusing on large language models.

연구 동기 및 목표

  • 기계학습에서 기밀성과 공정성 간의 상호관계를 이해하는 데 있어 중요한 격차를 해소하기 위해, 신뢰할 수 있는 인공지능의 공통 역할에도 불구하고 여전히 탐구가 부족한 분야를 다루는 것.
  • 다양한 학습 철학에서 전처리, 내처리, 후처리 기법을 포함한, 기밀성과 공정성을 통합하는 기존 방법들을 통합하고 분석하는 것.
  • 기밀성이 공정성에 영향을 주고 반대로 공정성이 기밀성에 영향을 주는 방식을 분석하여, 다양한 기계학습 환경에서의 상충관계와 일치관계를 규명하는 것.
  • 특히 대규모 언어 모델에서 기밀성과 공정성이 여전히 시급하지만 연구가 부족한 문제로 남아 있는 바, 열린 연구 과제를 규명하는 것.
  • 기능 손실을 최소화하면서 동시에 기계학습 파이프라인에서 기밀성과 공정성을 달성하기 위한 통합 프레임워크를 제공하는 것.

제안 방법

  • 기밀성과 공정성에 관한 150편 이상의 논문을 체계적으로 검토하여, 전처리, 내처리, 후처리 전략으로 방법을 분류한다.
  • 내처리 기법을 적대적 정규화기법(예: 민감한 속성 불변성을 위한 적대적 분류기)과 공정성 정규화기법(예: 편향 없는 그래프 기반 또는 반사적 공정성 기반 정규화)으로 분류한다.
  • 준지도학습(SSL) 기법을 분석하며, FairGNN과 같이 민감한 속성에 대해 노드 임베딩의 불변성을 확보하기 위해 적대적 학습을 사용하는 방법을 포함한다.
  • AdaFair 및 Fair Boosting과 같은 후처리 기법을 평가하여, 샘플을 재가중하거나 재표본 추출함으로써 통계적 평등성 확보 및 그룹 간 격차 감소를 도모한다.
  • 민감한 속성을 수정한 반사적 노드 표현을 생성하고 비교함으로써 그래프 신경망에서 반사적 공정성을 구현하기 위한 프레임워크를 제안한다.
  • Benefit Ratio 평가 지표를 통합하여 준지도학습에서 하위군 정확도 향상을 정량화하고, 공정성 인식 모델 평가를 가능하게 한다.
Figure 1. Computation of discrimination based on different metrics.
Figure 1. Computation of discrimination based on different metrics.

실험 결과

연구 질문

  • RQ1기계학습에서 기밀성과 공정성 간의 상호작용은 어떻게 이루어지며, 어떤 상황에서 상충되거나 일치하는가?
  • RQ2기능 손실을 최소화하면서 동시에 기밀성과 공정성을 최적화하는 데 가장 효과적인 아키텍처와 알고리즘은 무엇인가?
  • RQ3기존의 전처리, 내처리, 후처리 기법은 준지도학습 및 강화학습을 포함한 다양한 학습 철학에서 어떻게 성능을 발휘하는가?
  • RQ4대규모 언어 모델에서 기밀성과 공정성을 동시에 달성하는 데 있어 핵심 과제는 무엇인가?
  • RQ5그래프 기반 및 표본 기반 기계학습 모델에서 기밀성 제약 조건을 적용할 경우, 통계적 평등성 및 동일한 기회 지표와 같은 공정성 지표는 어느 정도 유지될 수 있는가?

주요 결과

  • FairGNN와 같은 그래프 신경망에서의 적대적 정규화기법은 민감한 특성 예측을 위한 분류기를 훈련하고 그 정확도를 최소화함으로써 노드 임베딩의 보호적 속성에 대한 민감도를 효과적으로 감소시킨다.
  • 편향 없는 그래프 기반의 공정성 정규화기법은 학습된 임베딩이 공정성 유지 기준 그래프에서 벗어나지 않도록 효과적으로 처벌함으로써, 노드 분류에서 통계적 평등성을 향상시킨다.
  • AdaFair 및 Fair Boosting과 같은 후처리 기법은 잘못 분류된 하위군에 대한 동적 재가중 및 샘플링된 학습 세트에서의 공정한 표현 확보를 통해 그룹 간 격차를 감소시킨다.
  • 준지도학습에서 기초 정확도가 낮은 하위집단은 허위라벨링 이후 성능 저하를 겪는 경향이 있어, 불공정성 증폭의 위험이 드러난다.
  • Benefit Ratio 지표는 하위군 간 정규화된 정확도 향상을 효과적으로 측정하며, 높은 기초 정확도 집단은 SSL에서 더 큰 이점을 얻는 반면, 낮은 기초 정확도 집단은 손해를 볼 수 있음을 드러낸다.
  • 민감한 속성을 수정한 노드 표현을 생성하고 비교하는 반사적 공정성 접근법은 그래프 기반 모델에서 민감한 속성에 대한 불변성을 달성하는 데 잠재력을 보이고 있다.
Holistic Survey of Privacy and Fairness in Machine Learning

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.