Skip to main content
QUICK REVIEW

[논문 리뷰] "You Can't Fix What You Can't Measure": Privately Measuring Demographic Performance Disparities in Federated Learning

Marc Juárez, Aleksandra Korolova|arXiv (Cornell University)|2022. 06. 24.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 사용자 프라이버시를 해치지 않으면서 피드리티드 러닝에서 인구통계적 성능 격차를 측정하기 위해 국소적 미분적 비밀보장(LDP) 메커니즘을 제안한다. 실제 클라이언트 수가 고려된 조건에서 이러한 메커니즘은 강력한 프라이버시 보장을 유지하면서 낮은 측정 오차를 달성하여, 민감한 인구통계 데이터에 대한 접근이 제한된 상황에서도 그룹 간 성능 불균형을 탐지할 수 있음을 보여준다.

ABSTRACT

As in traditional machine learning models, models trained with federated learning may exhibit disparate performance across demographic groups. Model holders must identify these disparities to mitigate undue harm to the groups. However, measuring a model's performance in a group requires access to information about group membership which, for privacy reasons, often has limited availability. We propose novel locally differentially private mechanisms to measure differences in performance across groups while protecting the privacy of group membership. To analyze the effectiveness of the mechanisms, we bound their error in estimating a disparity when optimized for a given privacy budget. Our results show that the error rapidly decreases for realistic numbers of participating clients, demonstrating that, contrary to what prior work suggested, protecting privacy is not necessarily in conflict with identifying performance disparities of federated models.

연구 동기 및 목표

  • 그룹 소속 정보가 프라이버시에 민감한 상황에서 피드리티드 러닝 모델의 성능 격차를 탐지하는 문제를 해결하기 위해.
  • 교차 장치 피드리티드 러닝 환경에서 성능 불균형을 식별하는 것과 인구통계적 특성의 프라이버시를 보호하는 두 목표 간의 갈등을 조율하기 위해.
  • 성능 격차를 추정하면서 프라이버시 예산 사용을 최소화하는 효율적인 국소적 미분적 비밀보장 메커니즘을 설계하기 위해.
  • 다양한 프라이버시 예산, 클라이언트 수, 그룹 규모 조건에서 이러한 메커니즘의 이론적 및 실증적 오차 한계를 평가하기 위해.
  • 중앙 집중형 어그리게이터의 협력 없이도 또는 원시 인구통계 데이터에 접근하지 않고도 모델 보유자나 규제 기관이 격차를 탐지할 수 있도록 하기 위해.

제안 방법

  • 피드리티드 러닝에서 성능 격차를 측정하기 위해 특화된 새로운 국소적 미분적 비밀보장(LDP) 메커니즘을 제안하며, 특히 그룹 소속 정보를 보호하기 위해 설계되었다.
  • 일반화된 랜덤라이즈드 응답(GRR) 메커니즘을 변형하여 인구통계적 특성과 성능 지표를 ε-LDP를 보장하는 방식으로 흐리게 처리한다.
  • 클라이언트로부터 온 흐릿한 데이터를 사용하여 인구통계 그룹 간 모델 정확도의 차이를 계산하는 성능 격차 추정 프레임워크를 도입한다.
  • 체비셰프 부등식을 사용하여 성능 격차 추정의 이론적 오차 한계를 유도하며, 프라이버시(ε)와 추정 정확도 간의 상충 관계를 분석한다.
  • 전체 프라이버시 제약 조건 하에서 추정 오차를 최소화하기 위해 그룹 간 프라이버시 예산 할당을 최적화하여, 불균형한 그룹 규모 상황에서도 유용성을 향상시킨다.
  • 실제 세계 시뮬레이션된 피드리티드 러닝 배포 환경에서 경계를 실증적으로 검증하여, 실제 오차가 이론적 상한선보다 뚜렷이 낮게 나타나 경계가 보수적임을 시사한다.

실험 결과

연구 질문

  • RQ1그룹 소속 정보가 민감하고 보호가 필요한 상황에서 피드리티드 러닝 모델의 성능 격차를 비밀스럽게 측정할 수 있는가?
  • RQ2LDP 메커니즘에서 성능 격차 추정 오차가 참여 클라이언트 수와 선택된 프라이버시 예산(ε)에 따라 어떻게 변화하는가?
  • RQ3LDP 메커니즘은 실제 피드리티드 러닝 환경에서 의미 있는 격차를 탐지할 수 있을 정도로 충분히 낮은 추정 오차를 달성할 수 있는가?
  • RQ4특히 SMPC나 비프라이버시 방법과 비교했을 때, 제안된 방법은 프라이버시-유용성 트레이드오프 측면에서 어떻게 다른가?
  • RQ5어그리게이터의 협력 없이도 메커니즘이 구현 가능하여 분산된 공정성 모니터링을 가능하게 하는가?

주요 결과

  • 제안된 LDP 메커니즘은 중간 수준의 프라이버시 예산 조건에서도 참여 클라이언트 수가 많을수록 성능 격차에 대해 낮은 측정 오차를 달성한다.
  • 체비셰프 부등식을 사용해 유도한 이론적 오차 한계는 클라이언트 수 증가에 따라 급격히 감소함을 보여주며, 강력한 확장성 잠재력을 시사한다.
  • 실제 세계 시뮬레이션된 피드리티드 러닝 환경에서의 실증 평가 결과, 실제 측정 오차는 이론적 상한선보다 뚜렷이 낮게 나타나 경계가 보수적임을 시사한다.
  • 메커니즘은 강력한 ε-LDP 보장을 유지하면서도 성능 격차의 정확한 탐지가 가능함을 입증하여, 프라이버시와 공정성 측정이 본질적으로 충돌하지 않음을 보여준다.
  • 그룹 간 최적의 프라이버시 예산 할당은 특히 불균형한 그룹 규모 상황에서 추정 오차를 감소시켜 공정성 모니터링 정확도를 향상시킨다.
  • 이 접근법은 원시 인구통계 데이터에 접근하지 않고도 모델 보유자나 규제 기관이 격차를 탐지할 수 있도록 하여, 실용적인 DFL 시스템에서 프라이버시 보존 공정성 감사를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.