[논문 리뷰] Leave No Stone Unturned: Mine Extra Knowledge for Imbalanced Facial Expression Recognition
이 논문은 장기적 데이터 분포에서 얼굴 표정 인식(FER)을 향상시키기 위해 소수의 클래스에 대한 추가 지식을 주요 및 소수 클래스 샘플에서 채굴하는 새로운 방법을 제안한다. 재균형화된 주의 일致성과 재균형화된 부드러운 레이블을 도입하여 모델의 일반화 능력을 향상시켜 데이터 재샘플링 없이 불균형 FER 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.
Facial expression data is characterized by a significant imbalance, with most collected data showing happy or neutral expressions and fewer instances of fear or disgust. This imbalance poses challenges to facial expression recognition (FER) models, hindering their ability to fully understand various human emotional states. Existing FER methods typically report overall accuracy on highly imbalanced test sets but exhibit low performance in terms of the mean accuracy across all expression classes. In this paper, our aim is to address the imbalanced FER problem. Existing methods primarily focus on learning knowledge of minor classes solely from minor-class samples. However, we propose a novel approach to extract extra knowledge related to the minor classes from both major and minor class samples. Our motivation stems from the belief that FER resembles a distribution learning task, wherein a sample may contain information about multiple classes. For instance, a sample from the major class surprise might also contain useful features of the minor class fear. Inspired by that, we propose a novel method that leverages re-balanced attention maps to regularize the model, enabling it to extract transformation invariant information about the minor classes from all training samples. Additionally, we introduce re-balanced smooth labels to regulate the cross-entropy loss, guiding the model to pay more attention to the minor classes by utilizing the extra information regarding the label distribution of the imbalanced training data. Extensive experiments on different datasets and backbones show that the two proposed modules work together to regularize the model and achieve state-of-the-art performance under the imbalanced FER task. Code is available at https://github.com/zyh-uaiaaaa.
연구 동기 및 목표
- 실제 데이터셋에서 심한 클래스 불균형으로 인해 소수의 감정 클래스에서 성능 저하가 발생하는 얼굴 표정 인식(FER) 문제를 해결한다.
- 기존 FER 방법이 소수 클래스 샘플만에 의존하여 주요 클래스에서 유용한 특징을 활용하지 못하는 한계를 극복한다.
- 데이터 재샘플링으로 인한 성능 저하 없이 주요 클래스에서 높은 정확도를 유지하면서 모든 클래스의 평균 정확도를 크게 향상시킨다.
- FER를 레이블 분포 학습 문제로 재정의하여 주요 클래스의 샘플이 소수 클래스에 대한 잠재적 지식을 담고 있음을 활용한다.
- 모든 훈련 샘플에서 변환 불변 특징을 추출함으로써 모델 일반화 능력을 향상시키는 경량이며 백본에 종속되지 않는 방법을 개발한다.
제안 방법
- 각 입력 샘플에 대해 모든 표정 클래스에 대해 주의 맵 일치성을 계산하는 재균형화된 주의 일치성 모듈을 제안하며, 이는 클래스별로 효과적인 샘플 수에 반비례하는 재균형화된 가중치를 사용한다.
- 레이블 분포에 클래스 균형 가중치를 적용하여 재균형화된 매끄러운 레이블을 도입함으로써 교차 엔트로피 손실을 정규화하여 훈련 중에 소수 클래스에 더 중점을 두게 한다.
- 지표 클래스가 아닌 모든 클래스의 주의 맵을 사용하여 모델이 강건하고 변환 불변 표현을 학습하도록 유도하며, 레이블 분포 학습의 영감을 받는다.
- 노이즈가 있는 레이블의 기억을 방지하고 특징 일반화를 향상시키기 위해 재균형화된 주의 일치성을 정규화 손실로 적용한다.
- 표준 교차 엔트로피 손실과 재균형화된 매끄러운 레이블 손실을 조합하여 모델의 결정 경계를 소수 클래스의 분류 성능 향상 방향으로 유도한다.
- 아키텍처 변경 없이도 다양한 백본(예: ResNet, Vision Transformers)과 호환되도록 플러그 앤 플레이 모듈을 설계한다.
실험 결과
연구 질문
- RQ1주요 얼굴 표정 클래스(예: 놀라움)의 샘플이 소수 클래스(예: 공포 또는 혐오)를 인식하는 데 유용하고 이식 가능한 특징을 담고 있는가?
- RQ2데이터 분포를 변경하지 않고 주요 및 소수 클래스 샘플에서 소수 클래스에 대한 지식을 효과적으로 추출하고 활용할 수 있는가?
- RQ3재균형화된 주의 일치성이 표준 주의 정규화를 초월해 불균형 FER에서 모델의 강건성과 일반화 능력을 향상시킬 수 있는가?
- RQ4레이블 분포 지식을 기반으로 한 재균형화된 매끄러운 레이블을 통합하면 소수 클래스의 성능 향상이 이루어지며 주요 클래스 정확도가 떨어지지 않는가?
- RQ5이 방법은 다양한 백본과 불균형 정도가 다른 다양한 데이터셋에서 얼마나 일반화 가능한가?
주요 결과
- 제안된 방법은 RAF-DB, AffectNet, FERPlus와 같은 여러 불균형 FER 벤치마크에서 최신 기술 수준의 평균 정확도를 달성한다.
- 장기적 분포를 가진 RAF-DB에서, 기준 모델 대비 최대 4.2% 향상된 평균 정확도를 기록했으며 전체 정확도도 높게 유지했다.
- 제거 실험 결과 재균형화된 주의 일치성과 재균형화된 매끄러운 레이블 모듈이 성능 향상에 독립적이고 상호 보완적으로 기여하는 것으로 확인되었다.
- ResNet-50 및 비전 트랜스포머를 포함한 다양한 백본에서 일관된 성능 향상을 보이며 강력한 일반화 능력과 플러그 앤 플레이 호환성을 입증했다.
- 주요 클래스(예: 기쁨, 중립)에서의 정확도가 크게 떨어지지 않으면서도 소수 클래스(예: 공포, 혐오)에서 더 높은 성능을 달성하여 클래스 불균형의 핵심 과제를 해결했다.
- 이 방법은 가볍고 효율적이며 데이터 재샘플링이나 복잡한 아키텍처 수정 없이 실생활 구현에 실용적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.