[논문 리뷰] Understanding and Mitigating Annotation Bias in Facial Expression Recognition
이 논문은 얼굴 표정 인식 데이터셋에서 체계적인 표기 편향을 드러내며, 특히 기쁨과 분노 표기에서 여성에게 유리하게 작용하는 경향을 보이고, 얼굴 운동 단위(AUs)와 트리플릿 손실을 사용하여 예측을 校정하고 편향을 줄이는 AUC-FER 프레임워크를 제안한다. 실험 결과, AUC-FER는 기준 모델 대비 64–89%의 차이를 보이며 차별성 수치를 감소시켜 기존의 편향 제거 방법을 초월한다.
The performance of a computer vision model depends on the size and quality of its training data. Recent studies have unveiled previously-unknown composition biases in common image datasets which then lead to skewed model outputs, and have proposed methods to mitigate these biases. However, most existing works assume that human-generated annotations can be considered gold-standard and unbiased. In this paper, we reveal that this assumption can be problematic, and that special care should be taken to prevent models from learning such annotation biases. We focus on facial expression recognition and compare the label biases between lab-controlled and in-the-wild datasets. We demonstrate that many expression datasets contain significant annotation biases between genders, especially when it comes to the happy and angry expressions, and that traditional methods cannot fully mitigate such biases in trained models. To remove expression annotation bias, we propose an AU-Calibrated Facial Expression Recognition (AUC-FER) framework that utilizes facial action units (AUs) and incorporates the triplet loss into the objective function. Experimental results suggest that the proposed method is more effective in removing expression annotation bias than existing techniques.
연구 동기 및 목표
- 인간 표기자가 성별에 따라 체계적으로 표정을 잘못 표기하는지, 특히 실외 환경에서의 데이터셋에서 그러한 경향이 있는지 조사하는 것.
- 데이터 구성 편향과는 다름없이 표기 편향이 얼굴 표정 인식에서 불공정한 모델 예측을 초래한다는 것을 입증하는 것.
- 다시 표기하거나 학습 데이터를 변경하지 않고도 체계적인 레이블 편향을 보정할 수 있는 편향 제거 프레임워크를 개발하는 것.
- 얼굴 운동 단위(AUs)를 객관적인 校정 신호로 사용하면 표정 인식 모델의 공정성이 향상된다는 것을 보여주는 것.
- 제안된 방법의 효과성을 다양한 아키텍처와 데이터셋 크기에서 검증하는 것.
제안 방법
- AUC-FER 프레임워크는 표정 레이블링의 주관성을 줄이기 위해 얼굴 운동 단위(AUs)를 보조적이고 객관적인 신호로 사용하여 학습 과정을 안내한다.
- 모델이 동일한 표정을 가진 이미지에 대해 성별이나 기타 보호된 특성과 관계없이 유사한 표현을 생성하도록 보장하기 위해 트리플릿 손실 함수를 통합한다.
- 표현 분류를 위한 교차 엔트로피와 AUs를 통한 공정성 校정을 위한 트리플릿 손실을 포함한 복합 손실을 사용해 엔드 투 엔드로 모델을 훈련시킨다.
- 프레임워크는 아키텍처에 종속되지 않게 설계되었으며, 정확도 평가를 위해 ResNet-50과 MobileNetV2에서 테스트되었다.
- 약한 지도 학습 기반의 AU 검출(예: OpenFace를 통한)을 객관적인 얼굴 특징 표현의 대체 신호로 활용하여 주관적인 표정 레이블을 校정한다.
- 데이터를 다시 표기할 필요가 없어 실세계의 편향된 표기 데이터셋에 실용적으로 적용할 수 있다.
실험 결과
연구 질문
- RQ1실외 환경의 얼굴 표정 데이터셋에서 남성과 여성 얼굴 간에 체계적인 표기 편향이 존재하는가?
- RQ2표기 편향이 데이터 구성 편향과 다를 때, 기존의 편향 제거 방법들이 표기 편향을 효과적으로 완화하지 못하는 정도는 어느 정도인가?
- RQ3얼굴 운동 단위(AUs)가 표정 인식에서 편향을 줄이기 위해 신뢰할 수 있는 객관적 校정 신호로 기능할 수 있는가?
- RQ4AUC-FER 프레임워크는 최신의 편향 제거 기법들에 비해 성별 기반의 차별성을 얼마나 효과적으로 줄이는가?
- RQ5제안된 방법은 다양한 모델 아키텍처와 학습 데이터 크기에서 일반화되는가?
주요 결과
- 연구는 실외 환경의 얼굴 표정 데이터셋에서 성별에 따른 심각한 표기 편향을 드러내며, 같은 표정 강도일지라도 여성의 얼굴이 더 자주 기쁨이나 분노로 표기된다는 점을 확인했다.
- 편향된 표기 데이터로 훈련된 기준 모델은 높은 차별성 수치를 보이며, ExpW 데이터셋에서 '기쁨' 표정에 대해 기준 ResNet-50 모델이 0.059 ± 0.035의 차별성 수치를 기록했다.
- AUC-FER 프레임워크는 ResNet-50에서 차별성 수치를 0.006 ± 0.020으로 낮춰 기준 모델 대비 89% 감소시켰다.
- 8,000개 샘플의 작은 학습 세트를 사용한 MobileNetV2에서도 AUC-FER는 기준 모델 대비 64%의 차별성 감소를 이끌어내며 0.028 ± 0.029의 수치를 기록했다.
- Uniform Confusion, Gradient Projection, Domain Discriminative/Independent 등의 기존 편향 제거 방법들보다 AUC-FER가 모든 평가 설정에서 뛰어난 성능을 보였다.
- 완전히 다시 표기된 데이터셋 수준의 성능에 근접하는 결과를 얻어, 재표기 없이도 표기 편향을 효과적으로 완화할 수 있음을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.