[논문 리뷰] Mitigate Bias in Face Recognition using Skewness-Aware Reinforcement Learning
논문은 비백인 인종에 대한 적응 여백을 학습하여 얼굴 인식에서 편향을 완화하는 강화 학습 프레임워크 RL-RBN을 소개하고 공정성 연구를 위한 인종 민감한 데이터셋을 공개한다.
Racial equality is an important theme of international human rights law, but it has been largely obscured when the overall face recognition accuracy is pursued blindly. More facts indicate racial bias indeed degrades the fairness of recognition system and the error rates on non-Caucasians are usually much higher than Caucasians. To encourage fairness, we introduce the idea of adaptive margin to learn balanced performance for different races based on large margin losses. A reinforcement learning based race balance network (RL-RBN) is proposed. We formulate the process of finding the optimal margins for non-Caucasians as a Markov decision process and employ deep Q-learning to learn policies for an agent to select appropriate margin by approximating the Q-value function. Guided by the agent, the skewness of feature scatter between races can be reduced. Besides, we provide two ethnicity aware training datasets, called BUPT-Globalface and BUPT-Balancedface dataset, which can be utilized to study racial bias from both data and algorithm aspects. Extensive experiments on RFW database show that RL-RBN successfully mitigates racial bias and learns more balanced performance for different races.
연구 동기 및 목표
- 균형 잡힌 데이터와 높은 정확도에도 나타나는 인종 편향을 해결하여 얼굴 인식의 공정성에 대한 동기를 부여한다.
- 인종 간 특성 분리의 내재-클래스 간 구분성을 균형 있게 하도록 적응 여백 학습 프레임워크를 제안한다.
- 강화 학습이 인종별 여백을 최적화하여 인종 간 왜곡(Bias)을 감소시키는 방법을 탐구한다.
- 민족성 인식 학습 데이터셋을 제공하여 FR 시스템의 데이터 및 알고리즘 편향을 연구한다.
제안 방법
- 마르코프 결정 프로세스(Markov Decision Process)로 인종 편향을 모델링하고 심층 Q-학습을 통해 인종별 적응 여백을 학습한다.
- 백인(코카시안) 인종은 고정 여백을 유지하고 비백인 인종의 여백은 정책 주도(alpha_j(t))로 정의하는 적응 여백 손실을 정의한다.
- 오프라인 샘플링 단계를 사용하여 DQN 학습에 필요한 상태-전이-보상 튜플을 수집한다.
- 상태 s를 인종 그룹 G, 현재 여백 M, 클래스 간 왜곡도 B_inter의 조합으로 정의하고, 행동은 여백을 수정하며 보상은 내부/외부 클래스 왜곡(B_intra + B_inter)을 형벌로 삼는다.
- 학습된 적응 여백 정책의 지침에 따라 인식 네트워크를 학습시켜 인종 간 균형 잡힌 성능을 달성한다.
- 두 가지 인종 인식 데이터셋(BUPT-Globalface 및 BUPT-Balancedface)을 도입하고 RFW 벤치마크에서 평가한다.
실험 결과
연구 질문
- RQ1강화 학습으로 학습된 적응적 인종별 여백이 얼굴 인식에서 교차 인종 성능 편향을 감소시킬 수 있는가?
- RQ2DQN에 왜곡도 보상을 포함시키면 인종 간 내부-외부 클래스 분리성을 더 균형 있게 만들 수 있는가?
- RQ3민족성 인식 학습 데이터셋이 FR 시스템의 데이터 및 알고리즘 편향을 진단하고 완화하는 데 도움이 되는가?
- RQ4RL-RBN은 공정성 지표에서 고정 여백 접근법(Softmax, Cosface, ArcFace)과 비교하여 어떤 차이가 있는가?
주요 결과
- RL-RBN 및 그 변형들이 기본 여백 대비 공정성 지표를 크게 향상시킨다(표준 편차 STD 및 SER 감소).
- RFW에서 RL-RBN(soft)는 STD 0.66, SER 1.17를 달성하는 반면, 유사 설정에서 Norm-Softmax의 STD 2.64, SER 1.53과 비교된다.
- 균형된 학습 데이터에서 RL-RBN(Cos/Arc)은 고정 여백 대비 내부-외부 인종 간 구분성의 균형 평균 정확도 및 간섭 감소를 보였다.
- BUPT-Globalface에서 RL-RBN(soft)는 평균 성능 94.45, STD 0.44, SER 1.20으로 Softmax(STD 2.48, SER 1.78) 및 다른 기준선보다 우수하다.
- BUPT-Balancedface에서 RL-RBN(Cos/Arc)는 고정 여백 접근법보다 더 낮은 STD/SER로 평균 약 95.0에 도달했다.
- 적응 여백은 더 어려운 그룹(아시아인, 아프리카인)에게 더 큰 여백을, 더 쉬운 그룹에는 더 작은 여백을 배정하는 경향을 보이며, 학습 정책에 의해 유도된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.