Skip to main content
QUICK REVIEW

[논문 리뷰] Emotion Recognition with Incomplete Labels Using Modified Multi-task Learning Technique

Phan Tran Dac Thinh, Hoàng Mạnh Hùng|arXiv (Cornell University)|2021. 07. 08.
Emotion and Mood Recognition인용 수 11
한 줄 요약

이 논문은 AffWild2 데이터셋에서 레이블이 불완전한 상황에서 정서 인식과 얼굴 행동 단위 감지를 향상하기 위해 ResNet50를 사용하고 VGGFace2 사전학습을 적용한 수정된 다중 작업 학습 방법을 제안한다. 클래스 불균형 문제를 해결하기 위해 Focal Loss를 사용하여 7개 기본 정서와 12개 행동 단위를 동시에 학습함으로써, 정서 분류에서 F1-가중 정확도 0.757, 행동 단위 감지에서 0.731을 달성하여 단일 작업 기반 베이스라인보다 뚜렷이 뛰어난 성능을 보였다.

ABSTRACT

The task of predicting affective information in the wild such as seven basic emotions or action units from human faces has gradually become more interesting due to the accessibility and availability of massive annotated datasets. In this study, we propose a method that utilizes the association between seven basic emotions and twelve action units from the AffWild2 dataset. The method based on the architecture of ResNet50 involves the multi-task learning technique for the incomplete labels of the two tasks. By combining the knowledge for two correlated tasks, both performances are improved by a large margin compared to those with the model employing only one kind of label.

연구 동기 및 목표

  • AffWild2와 같은 정서 컴퓨팅 데이터셋에서 레이블이 불완전하고 불균형한 문제에 대응하기 위해.
  • 다중 작업 학습을 통해 공유 표현을 활용하여 정면 정서 분류 및 행동 단위 감지 성능을 향상시키기 위해.
  • 7개 기본 정서 데이터셋의 클래스 불균형 문제를 Focal Loss를 통해 완화하기 위해.
  • 실생활 비구속적인 얼굴 데이터에서 공유 백본 아키텍처와 다중 작업 학습의 효과를 평가하기 위해.

제안 방법

  • ImageNet 사전학습 가중치를 사용한 ResNet50를 백본으로 사용하고, 정면 정서 인식에 더 나은 일반화를 위해 VGGFace2 사전학습을 통해 미세조정한다.
  • 세 가지 다른 데이터 세트를 처리하는 수정된 다중 작업 학습 체계를 적용한다: 오직 정서 레이블이 있는 이미지, 오직 AU 레이블이 있는 이미지, 두 가지 레이블이 모두 있는 이미지.
  • 7개 클래스 정서 분류 작업에 Focal Loss를 적용하여 장꼬리 클래스 분포 문제를 해결하고 소수 클래스의 성능을 향상시킨다.
  • 12개의 다중 레이블 행동 단위 감지 작업에 이진 교차 엔트로피 손실을 사용한다.
  • 3단계 학습 루프를 구현한다: 첫 번째로 정서 전용 데이터로 업데이트, 두 번째로 AU 전용 데이터로 업데이트, 세 번째로 공동 레이블이 있는 데이터로 업데이트하며, 이 모든 과정은 하나의 최적화 사이클 내에서 수행된다.
  • 데이터 증강 없이 입력 이미지를 정규화한다 (112×112, RGB), 오디오는 불일치하는 가용성과 품질로 인해 제외한다.

실험 결과

연구 질문

  • RQ1레이블이 불완전할 때 공유 표현을 활용한 다중 작업 학습이 정서 분류와 행동 단위 감지 성능 향상에 기여하는가?
  • RQ27개 기본 정서 데이터셋에서 클래스 불균형으로 인한 성능 저하를 완화하기 위해 Focal Loss가 얼마나 효과적인가?
  • RQ3ImageNet 또는 EmotionNet 사전학습 대비 VGGFace2 사전학습을 사용할 경우 AffWild2 데이터셋에서 모델 일반화 성능이 향상되는가?
  • RQ4공유 백본 아키텍처가 두 정서 인식 작업 간의 특징 학습을 얼마나 향상시키는가?
  • RQ5부분적으로 레이블이 붙은 데이터를 별도로 처리하는 제안된 학습 체계가 기존 다중 작업 학습보다 더 나은 수렴과 성능을 보이는가?

주요 결과

  • 제안된 방법은 7개 기본 정서 분류 작업에서 F1-가중 정확도 0.757을 달성하여 기준 모델의 0.366과 단일 작업 ResNet50(EmotionNet) 기준 모델의 0.462보다 뚜렷이 향상된 성능을 보였다.
  • Focal Loss와 다중 작업 학습을 적용한 모델은 F1-가중 정확도 0.757을 기록하여 공유 백본 전용 접근법(0.713)과 VGGFace2 사전학습 기준 모델(0.556)을 모두 초월했다.
  • 얼굴 행동 단위 감지에서는 다중 작업 학습 접근법이 F1-가중 정확도 0.731을 달성하여 단일 작업 기준 모델(0.31)과 공유 백본 기준 모델(0.655)을 모두 뛰어넘었다.
  • VGGFace2 사전학습을 사용함으로써 이미지넷 또는 EmotionNet 사전학습 대비 두 작업 모두에서 성능 향상이 뚜렷하게 관찰되었다.
  • 정서 전용, AU 전용, 공동 레이블이 있는 데이터를 별도로 처리하는 학습 체계는 레이블이 불완전한 상황에서의 수렴과 성능 향상에 기여했으며, 특히 이러한 상황에서 유의미한 개선을 보였다.
  • 단지 10 에포크 만에 최적의 성능을 달성하여 제안된 학습 전략과 학습률 스케줄링이 효과적인 학습을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.