Skip to main content
QUICK REVIEW

[논문 리뷰] FERV39k: A Large-Scale Multi-Scene Dataset for Facial Expression Recognition in Videos

Yan Wang, Yixuan Sun|arXiv (Cornell University)|2022. 03. 17.
Emotion and Mood Recognition인용 수 5
한 줄 요약

FERV39k는 일상생활, 약상호작용 쇼, 강상호작용 활동, 이면 문제의 4가지 시나리오에 걸쳐 총 22개의 장면에서 38,935개의 클립을 포함하는 대규모 다중 장면 영상 데이터셋으로, 7가지 기본적인 얼굴 표정으로 레이블링되어 있다. 이 데이터셋은 영상 기반 얼굴 표정 인식을 위한 딥러닝 모델의 강력한 벤치마크를 가능하게 하며, 전체 데이터셋에서 Two VGG13-LSTM 프레임워크를 사용하여 44.54%의 정확도를 달성하여 최신 기술 수준에 도달하였다. 또한 다양한 장면 간의 뚜렷한 성능 격차를 드러내며, 장면 인식 기반 FER 모델의 필요성을 강조한다.

ABSTRACT

Current benchmarks for facial expression recognition (FER) mainly focus on static images, while there are limited datasets for FER in videos. It is still ambiguous to evaluate whether performances of existing methods remain satisfactory in real-world application-oriented scenes. For example, the "Happy" expression with high intensity in Talk-Show is more discriminating than the same expression with low intensity in Official-Event. To fill this gap, we build a large-scale multi-scene dataset, coined as FERV39k. We analyze the important ingredients of constructing such a novel dataset in three aspects: (1) multi-scene hierarchy and expression class, (2) generation of candidate video clips, (3) trusted manual labelling process. Based on these guidelines, we select 4 scenarios subdivided into 22 scenes, annotate 86k samples automatically obtained from 4k videos based on the well-designed workflow, and finally build 38,935 video clips labeled with 7 classic expressions. Experiment benchmarks on four kinds of baseline frameworks were also provided and further analysis on their performance across different scenes and some challenges for future research were given. Besides, we systematically investigate key components of DFER by ablation studies. The baseline framework and our project will be available.

연구 동기 및 목표

  • 실생활 비제약 환경에서 얼굴 표정 인식(FER)을 위한 대규모, 다중 장면, 고품질 영상 데이터셋의 부족을 해결하기 위해.
  • 기존 데이터셋의 한계인 장면의 동질성, 부족한 규모, 장면 수준의 차별성 부족을 극복하기 위해.
  • 후보 영상 클립 생성과 고품질 수동 레이블링을 위한 체계적이고 확장 가능한 워크플로우 개발을 위해.
  • 다양한 실생활 시나리오에서 FER 모델 평가를 위한 벤치마크를 구축하여, 다양한 장면 맥락에서의 성능 변동성과 과제를 드러내기 위해.

제안 방법

  • 데이터셋은 네 단계 전략을 통해 구성된다: (1) 장면 다양성과 맥락의 독립성을 기반으로 4개의 시나리오와 22개의 세분화된 장면을 정의하고, (2) 4,000개의 원본 영상에서 잘 설계된 영상 클립 생성 파이프라인을 통해 자동으로 86,000개의 후보 영상 클립을 생성한다.
  • 하이브리드 레이블링 프로세스를 적용: 초기 단계에서 빠른 레이블링을 위해 커뮤니티 기반 레이블링을 실시하고, 이후 엄격한 품질 관리를 통한 전문가 레이블링을 통해 고정밀도, 세분화된 표정 레이블을 확보한다.
  • 최종 데이터셋은 38,935개의 영상 클립을 포함하며, 7가지 고전적 표정(예: 기쁨, 슬픔, 분노)이 포함되어 있으며, 지속시간은 0.5초에서 4초까지 다양하다. 또한 336×504 해상도로 100만 장의 얼굴 프레임과 224×224 해상도로 100만 장의 얼굴 크롭 영상이 포함되어 있다.
  • I3D, 3D-R18, VGG13-LSTM, ResNet-LSTM 등의 베이스라인 모델을 전체 데이터셋에 대해 훈련하고, 모든 장면과 하위 장면에서 평가하여 일반화 능력과 장면별 성능를 분석한다.
  • 종합적인 성능 분석을 위해 종단 간 영상 표정 인식의 핵심 요소를 분석하기 위한 추상화 연구를 수행한다. 이는 시간적 모델링 및 특징 추출 전략을 포함한다.
  • 전체 정확도와 장면별 지표를 사용하여 성능을 평가하며, 오류 패턴을 분석하기 위해 혼동 행렬을 시각화한다.

실험 결과

연구 질문

  • RQ1표정 강도가 동일한 상황이라도, 예를 들어 '인터뷰'와 '공식 행사' 장면 간에 모델 성능가 어떻게 달라지는가?
  • RQ2기존의 딥러닝 아키텍처가 얼굴 표정 인식에서 다양한 비제약 영상 장면에 얼마나 잘 일반화되는가?
  • RQ3장면 특화 맥락이 얼굴 표정 인식 모델의 신뢰성과 일관성에 어떤 영향을 미치는가?
  • RQ4제안된 네 단계 파이프라인은 레이블링에 적합한 고품질 대규모 영상 클립 후보를 얼마나 효과적으로 생성하는가?
  • RQ5종단 간 영상 기반 얼굴 표정 인식에서 성능에 크게 기여하는 핵심 요소는 무엇인가?

주요 결과

  • Two VGG13-LSTM 모델은 전체 FERV39k 데이터셋에서 가장 높은 전체 정확도 44.54%를 기록하였으며, I3D 및 3D-R18 등의 다른 아키텍처를 능가하였다.
  • 장면 간 뚜렷한 성능 변동성이 관찰되었으며, '비즈니스' 장면에서는 63.72%의 정확도를 기록한 반면, 'AI9k' 장면에서는 단지 31.68%에 머물러 있어 강한 도메인 이동과 장면 특화 과제를 시사한다.
  • 모든 장면에서 훈련된 모델은 '인터뷰'나 '범죄'와 같은 하위 장면에 대해 일반화 성능이 떨어지며, 정확도가 각각 33.73%와 27.33%로 떨어져 장면 인식 기반 적응의 필요성을 강조한다.
  • 혼동 행렬 분석 결과, '기쁨'과 '슬픔'은 특히 '라이브 쇼'나 '토크 쇼' 장면에서 강도가 낮거나 모호한 맥락에서 자주 잘못 분류되는 경향이 있다.
  • 추상화 연구 결과, LSTM 레이어를 통한 시간적 모델링이 성능 향상에 크게 기여하며, Two VGG13-LSTM는 44.54%의 정확도를 기록한 반면 VGG16-LSTM는 41.70%에 머물러 있어 순서 모델링의 중요성을 입증한다.
  • 데이터셋은 장면 맥락이 핵심 요소임을 드러내며, 다양한 장면에서 훈련된 모델은 전체적으로 더 나은 성능을 보이지만, 새로운 또는 겹침이 적은 장면에서 성능이 급격히 떨어지는 경향이 있어, 장면 인식 기반 FER 시스템의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.