Skip to main content
QUICK REVIEW

[논문 리뷰] DFEW: A Large-Scale Database for Recognizing Dynamic Facial Expressions in the Wild

Xingxun Jiang, Yuan Zong|arXiv (Cornell University)|2020. 08. 13.
Emotion and Mood Recognition참고 문헌 42인용 수 9
한 줄 요약

이 논문은 1,500部 영화에서 추출한 16,372개의 비디오 클립을 포함한 대규모 실외 동적 표정 데이터베이스인 DFEW를 소개한다. 이 데이터베이스는 자세 변화와 가림 등 다양한 실제 환경 도전 과제를 수반한다. 또한 동적 FER 성능을 향상시키기 위해 표정 인식 기반의 시공간 특징을 학습하는 Expression-Clustered Spatiotemporal Feature Learning (EC-STFL) 프레임워크를 제안하며, DFEW 및 전이 학습 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recently, facial expression recognition (FER) in the wild has gained a lot of researchers' attention because it is a valuable topic to enable the FER techniques to move from the laboratory to the real applications. In this paper, we focus on this challenging but interesting topic and make contributions from three aspects. First, we present a new large-scale 'in-the-wild' dynamic facial expression database, DFEW (Dynamic Facial Expression in the Wild), consisting of over 16,000 video clips from thousands of movies. These video clips contain various challenging interferences in practical scenarios such as extreme illumination, occlusions, and capricious pose changes. Second, we propose a novel method called Expression-Clustered Spatiotemporal Feature Learning (EC-STFL) framework to deal with dynamic FER in the wild. Third, we conduct extensive benchmark experiments on DFEW using a lot of spatiotemporal deep feature learning methods as well as our proposed EC-STFL. Experimental results show that DFEW is a well-designed and challenging database, and the proposed EC-STFL can promisingly improve the performance of existing spatiotemporal deep neural networks in coping with the problem of dynamic FER in the wild. Our DFEW database is publicly available and can be freely downloaded from https://dfew-dataset.github.io/.

연구 동기 및 목표

  • 비자발적 환경을 위한 대규모이고 현실적인 동적 표정 데이터베이스의 부족을 해결하기 위해.
  • 일조 변화, 가림, 자세 변화 등의 실생활 과제를 다룰 수 있는 강력한 딥 러닝 프레임워크를 개발하기 위해.
  • 실생활 응용에서 성능 향상과 전이 학습을 가능하게 하는 벤치마크 데이터셋과 프레임워크를 구축하기 위해.

제안 방법

  • DFEW 데이터베이스는 1,500편 이상의 영화에서 16,372개의 비디오 클립을 추출하여 구성된다. 이는 자연스럽고 비제약적인 표정을 캡처한다.
  • 각 비디오 클립은 10명의 독립적이고 숙련된 평가자에 의해 애니메이션되어 7가지 기본 표정의 신뢰할 수 있는 분포를 확보한다.
  • EC-STFL 프레임워크는 표정 카테고리 기반으로 특징을 군집화하는 새로운 손실 함수를 도입하여, 시공간 특징 학습의 분류 능력을 향상시킨다.
  • 표현 인식 기반 군집화 손실과 표준 분류 손실을 균형 잡기 위해 무게 매개변수 λ를 통합한다.
  • 다양한 배치 크기에서 안정적인 훈련을 보장하기 위해 다양한 배치 크기에서 배치 정규화 전략을 적용한다.
  • AFEW7.0에서 일반화 능력을 평가하기 위해 DFEW 및 기타 액션 데이터셋에서 사전 훈련된 모델을 사용한 전이 학습 실험을 수행한다.

실험 결과

연구 질문

  • RQ1표준 시공간 네트워크에 비해 제안된 EC-STFL 프레임워크는 비자발적 실생활 환경에서 동적 표정 인식 성능을 어떻게 향상시키는가?
  • RQ2DFEW 데이터베이스는 실생활 응용에서 정서 인식을 위한 전이 학습 성능을 얼마나 향상시키는가?
  • RQ3EC-STFL 프레임워크는 무게 매개변수 λ와 배치 크기와 같은 하이퍼파라미터에 얼마나 민감한가?
  • RQ4DFEW 데이터베이스는 기존의 액션 인식 데이터셋보다 더 나은 성능을 보이며, 하류 정서 인식 작업을 위한 강력한 사전 훈련 소스로 활용될 수 있는가?
  • RQ5다중 평가자 레이블링이 DFEW 데이터셋의 신뢰성과 동적 FER 연구에 대한 유용성에 미치는 영향은 무엇인가?

주요 결과

  • DFEW fd2에서 미세조정한 EC-STFL 프레임워크는 AFEW7.0 벤치마크에서 WAR 점수 53.26을 기록하여 이전 최고 기술 수준의 방법보다 약 2%포인트 높은 성능을 달성했다.
  • DFEW에서의 전이 학습은 UCF101, Sports 1M, Kinect700 등의 다른 대규모 액션 데이터셋에서의 전이 학습보다 뛰어난 성능을 보이며, DFEW가 사전 훈련 소스로 효과적임을 입증했다.
  • C3D와 3D ResNet18와 같은 다양한 백본 네트워크에서 배치 크기와 무게 매개변수 λ의 변화에 관계없이 EC-STFL 프레임워크는 일관된 성능 향상을 보였다.
  • 표현 레이블 세트의 신뢰성과 균형 잡힌 분포를 확보하기 위해 샘플당 10명의 독립 평가자가 참여하여 DFEW 데이터베이스는 높은 레이블 신뢰도를 확보했다.
  • 민감도 분석 결과 EC-STFL는 넓은 범위의 배치 크기와 최적의 무게 매개변수 λ에서 안정적인 성능을 보이며, 강력한 일반화 능력과 내구성을 입증했다.
  • 1,500편의 다양한 영화에서 추출한 16,372개의 클립을 포함한 DFEW 데이터베이스는 현재 공개된 바 있는 가장 큰 실외 동적 표정 데이터베이스로, FER 연구에 풍부한 실제 환경 변동성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.