Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-model Ensemble Learning Method for Human Expression Recognition

Jun Yu, Zhongpeng Cai|arXiv (Cornell University)|2022. 03. 28.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 인간 표정 인식을 위한 다중 모델 앙상블 학습 방법을 제안하며, ResNet, EfficientNet, InceptionNet 백본과 포칼 손실을 결합하여 클래스 불균형 문제를 해결한다. 이 방법은 AffWild2 데이터셋에서 내부 폴드 및 크로스 폴드 앙상블 전략을 사용하여 모델 융합과 데이터 분포 다양성을 통해 F1 점수를 향상시키며, 실제 세계의 표정 인식 시나리오에서 뛰어난 성능을 보여준다.

ABSTRACT

Analysis of human affect plays a vital role in human-computer interaction (HCI) systems. Due to the difficulty in capturing large amounts of real-life data, most of the current methods have mainly focused on controlled environments, which limit their application scenarios. To tackle this problem, we propose our solution based on the ensemble learning method. Specifically, we formulate the problem as a classification task, and then train several expression classification models with different types of backbones--ResNet, EfficientNet and InceptionNet. After that, the outputs of several models are fused via model ensemble method to predict the final results. Moreover, we introduce the multi-fold ensemble method to train and ensemble several models with the same architecture but different data distributions to enhance the performance of our solution. We conduct many experiments on the AffWild2 dataset of the ABAW2022 Challenge, and the results demonstrate the effectiveness of our solution.

연구 동기 및 목표

  • 제한된 자료와 높은 복잡도를 가진 실생활(야생) 비디오 환경에서 인간 얼굴 표정을 인식하는 데 도전하는 것.
  • 다양한 딥 러닝 아키텍처(ResNet, EfficientNet, InceptionNet)를 활용하여 특징 추출함으로써 인식 성능 향상시키는 것.
  • 모델 훈련 중에 포칼 손실을 사용하여 AffWild2 데이터셋의 클래스 불균형 문제를 완화하는 것.
  • 다른 데이터 분할을 사용한 다중 폴드 앙상블 전략을 적용하여 모델의 일반화 능력과 강건성을 향상시키는 것.
  • 앙상블 기반의 융합을 통해 ABAW2022 표정 분류 챌린지에서 최고 성능을 달성하는 것.

제안 방법

  • VGGFace2 또는 ImageNet에서 사전 학습된 가중치를 초기화하여 ResNet50, EfficientNet-b0, InceptionNet-v1을 백본으로 사용한 세 개의 별도 표정 분류 모델을 훈련시켰다.
  • 훈련 데이터 다양성을 높이고 모델 일반화 능력을 향상시키기 위해 RandomHorizontalFlipping 및 ColorJitter와 같은 데이터 증강 기법을 적용했다.
  • 이중 단계 앙상블 전략을 사용했다: 첫 번째 단계에서는 서로 다른 백본 모델의 출력을 학습 가능한 융합 가중치로 융합하고, 두 번째 단계에서는 동일한 아키텍처이지만 다른 데이터 분할을 사용한 5폴드 교차 검증을 통해 모델를 훈련하고 앙상블했다.
  • AffWild2 데이터셋의 클래스 불균형 문제를 해결하기 위해 포칼 손실을 손실 함수로 사용하였으며, 정의는 $\mathbf{F}\mathbf{L}(p)=\sum_{i=1}^{m}y_{i}\alpha_{i}(1-p_{i})^{\gamma_{i}}\log(p_{i})$ 이며, 클래스별 가중치 $\alpha_i$와 집중 파라미터 $\gamma$를 포함한다.
  • NVIDIA Tesla A100 GPU에서 배치 크기를 256으로 설정하고, 코즈인 애너일링 학습률 스케줄러를 사용한 Adam 옵timizer를 사용하여 훈련 과정을 최적화했다.
  • 최종 예측을 모두 융합하기 위해 가중 평균을 사용하여 성능을 극대화하였으며, 융합 가중치는 검증 성능 기반으로 튜닝되었다.

실험 결과

연구 질문

  • RQ1다양한 구조적 설계를 가진 다수의 딥 러닝 아키텍처를 융합함으로써 야생 영상 데이터에서의 표정 인식 성능 향상이 가능한가?
  • RQ2포칼 손실이 AffWild2 데이터셋의 표정 분류에서 클래스 불균형 문제 완화에 얼마나 효과적인가?
  • RQ3다른 데이터 분포를 가진 다양한 데이터 폴드에서 모델를 훈련하고 앙상블함으로써 모델의 강건성과 일반화 능력 향상이 가능한가?
  • RQ4모델 앙상블 학습이 야생 환경에서의 단일 모델 베이스라인에 비해 얼마나 뛰어난 성능을 보이는가?
  • RQ5다른 백본과 데이터 분할에서 훈련된 다양한 모델의 예측을 융합하는 데 최적의 융합 전략은 무엇인가?

주요 결과

  • 다중 모델 앙상블 방법은 AffWild2 테스트 세트에서 최종 평균 F1 점수 0.421을 달성하여 개별 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • ResNet50는 Fold 1에서 가장 높은 F1 점수 0.317를 기록했고, EfficientNet-b0와 InceptionNet-v1은 다양한 폴드에서 경쟁적인 성능를 보이며 상호 보완적인 특징 학습을 나타냈다.
  • 크로스 폴드 앙상블 전략은 분산을 줄이고 일반화 능력을 향상시켜, 다른 데이터 분할에서 훈련된 모델을 융합함으로써 성능 향상에 기여했다.
  • 포칼 손실의 사용은 소수 클래스에서의 수렴을 향상시키고 F1 점수를 향상시켜, AffWild2 데이터셋의 장꼬리 분포 문제를 효과적으로 해결했다.
  • 다양한 융합 구성에서 유도된 결과를 융합한 최종 앙상블 모델는 최고의 종합 성능를 기록하였으며, 제안된 다중 모델 및 다중 폴드 앙상블 접근법의 효과성을 확인했다.
  • 이 방법은 제한된 환경에서도 강건성과 일반화 능력이 뛰어나 실생활 인간-컴퓨터 상호작용 응용 분야에 적합함을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.