[논문 리뷰] Evaluating Proposed Fairness Models for Face Recognition Algorithms
이 논문은 126개 알고리즘의 민족적·성별 분리된 오류율을 포함하는 새로 공개된 데이터셋을 사용하여 두 가지 기존의 공정성 측정법을 평가한다. 이는 해석 가능성에 기여하는 기능적 공정성 측정 기준(FFMC)을 제안하며, 정확도와 공정성을 균형 잡는 데 목적이 있는 페어레토 최적화를 통합한 새로운 공정성 지표인 GARBE를 도입하여 실세계 구현에 적합한 알고리즘 선택 프레임워크를 제공한다.
The development of face recognition algorithms by academic and commercial organizations is growing rapidly due to the onset of deep learning and the widespread availability of training data. Though tests of face recognition algorithm performance indicate yearly performance gains, error rates for many of these systems differ based on the demographic composition of the test set. These "demographic differentials" in algorithm performance can contribute to unequal or unfair outcomes for certain groups of people, raising concerns with increased worldwide adoption of face recognition systems. Consequently, regulatory bodies in both the United States and Europe have proposed new rules requiring audits of biometric systems for "discriminatory impacts" (European Union Artificial Intelligence Act) and "fairness" (U.S. Federal Trade Commission). However, no standard for measuring fairness in biometric systems yet exists. This paper characterizes two proposed measures of face recognition algorithm fairness (fairness measures) from scientists in the U.S. and Europe. We find that both proposed methods are challenging to interpret when applied to disaggregated face recognition error rates as they are commonly experienced in practice. To address this, we propose a set of interpretability criteria, termed the Functional Fairness Measure Criteria (FFMC), that outlines a set of properties desirable in a face recognition algorithm fairness measure. We further develop a new fairness measure, the Gini Aggregation Rate for Biometric Equitability (GARBE), and show how, in conjunction with the Pareto optimization, this measure can be used to select among alternative algorithms based on the accuracy/fairness trade-space. Finally, we have open-sourced our dataset of machine-readable, demographically disaggregated error rates. We believe this is currently the largest open-source dataset of its kind.
연구 동기 및 목표
- 얼굴 인식 알고리즘을 위한 두 가지 제안된 공정성 측정법의 해석 가능성과 실용적 유용성을 평가하는 것.
- 인종과 성별에 따라 분리된 실제 오류율 데이터에 적용되었을 때 기존 공정성 측정법의 한계를 규명하는 것.
- 생체인식 시스템에서 공정성 측정법을 평가하기 위한 해석 가능성 기준 집합인 기능적 공정성 측정 기준(FFMC)을 수립하는 것.
- 정확도-공정성 트레이드오프를 효과적으로 균형 잡을 수 있도록 하는 새로운 공정성 지표인 Gini Aggregation Rate for Biometric Equitability(GARBE)를 개발하는 것.
- 향후 연구를 지원하기 위해 가장 큰 공개 가능한 민족적·성별 분리된 얼굴 인식 오류율 데이터셋과 코드를 공개함으로써 투명성과 재현 가능성을 증진하는 것.
제안 방법
- 저자들은 NIST 보고서에서 126개 얼굴 인식 알고리즘의 오류율을 수집하고, 이를 인종과 성별로 분리하여 기계로 읽을 수 있는 CSV 데이터셋으로 변환하였다.
- 이 데이터셋을 사용하여 두 가지 기존의 공정성 측정법을 평가하였으며, 그들의 수학적 성질과 실제 적용 상황에서의 해석 가능성도 분석하였다.
- 기능적 공정성 측정 기준(FFMC)은 단조성, 유계성, 민족적 불균형에 대한 민감성 등의 바람직한 성질을 포함하는 집합으로 정의되었다.
- 기존의 지니 계수를 기반으로 하여 생체인식 공정성에 적합한 Gini Aggregation Rate for Biometric Equitability(GARBE)라는 새로운 공정성 지표를 개발하였다.
- 정확도와 공정성 간의 트레이드오프 공간에서 최적의 균형을 이루는 알고리즘 설정을 찾기 위해 페어레토 최적화를 적용하였다.
- 데이터셋과 코드는 향후 머신러닝 공정성 연구를 지원하기 위해 GitHub에 공개되었다.
실험 결과
연구 질문
- RQ1기존의 공정성 측정법은 실제 민족적·성별 분리된 얼굴 인식 오류율 데이터에 적용되었을 때 어떻게 작동하는가?
- RQ2생체인식 시스템에서 공정성 측정법을 평가하기 위해 필수적인 수학적 성질과 해석 가능성 특성은 무엇인가?
- RQ3정확도와 공정성을 민족적 집단 간에 효과적으로 균형 잡는 새로운 공정성 지표를 설계할 수 있는가?
- RQ4현재의 공정성 측정법은 통계적 공정성 외에도 인식적 또는 사회적 개념의 공정성과 얼마나 잘 부합하는가?
- RQ5개방형 데이터와 표준화된 평가 프레임워크는 얼굴 인식에서 강력한 공정성 측정법 개발을 어떻게 향상시킬 수 있는가?
주요 결과
- 평가된 두 공정성 측정법은 특히 소규모 집단이 존재할 경우 실제 오류율 데이터에 적용되었을 때 해석하기 어려운 수학적 성질을 보였다.
- 제안된 기능적 공정성 측정 기준(FFMC)은 생체인식 응용 분야에서 공정성 측정법의 적합성을 평가하기 위한 체계적인 프레임워크를 제공한다.
- GARBE 지표는 민족적 집단 간 공정성의 균형을 효과적으로 측정할 수 있으며, 정확도-공정성 트레이드오프 공간에서 효과적인 페어레토 최적화를 가능하게 한다.
- 공개된 126개 얼굴 인식 알고리즘의 민족적·성별 분리된 오류율 데이터셋은 지금까지 공개된 바 중 가장 크다.
- 이 연구는 공정성 감사의 질을 향상시키기 위해 상호 집단 간 오류율과 다중 임계값 성능까지 포함한 보다 포괄적인 데이터셋이 필요하다고 지적한다.
- 수학적 공정성과 인식적 공정성 사이에 여전히 심각한 격차가 존재하며, 이는 통계적으로 공정한 시스템이라도 사용자에게는 불공정하게 느껴질 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.