Skip to main content
QUICK REVIEW

[논문 리뷰] EmotiW 2018: Audio-Video, Student Engagement and Group-Level Affect Prediction

Abhinav Dhall, Amanjot Kaur|arXiv (Cornell University)|2018. 08. 23.
Emotion and Mood Recognition참고 문헌 20인용 수 11
한 줄 요약

이 논문은 ICMI 2018에서 개최된 다중모odal 정서 인식 도전 대회인 EmotiW 2018을 제시한다. 이 대회에는 음성-시각 정서 인식, MOOC에서의 학생 참여도 예측, 그룹 수준의 정서 인식의 세 가지 하위 과제가 포함되어 있다. 새로운 학생 참여도 데이터셋을 제공하여 훈련용 149개, 검증용 48개, 테스트용 67개의 영상으로 구성되었으며, 딥 러닝 앙상블를 활용한 최상위 모델이 음성-시각 정서 인식 과제에서 61.87%의 정확도를 기록하였다.

ABSTRACT

This paper details the sixth Emotion Recognition in the Wild (EmotiW) challenge. EmotiW 2018 is a grand challenge in the ACM International Conference on Multimodal Interaction 2018, Colorado, USA. The challenge aims at providing a common platform to researchers working in the affective computing community to benchmark their algorithms on `in the wild' data. This year EmotiW contains three sub-challenges: a) Audio-video based emotion recognition; b) Student engagement prediction; and c) Group-level emotion recognition. The databases, protocols and baselines are discussed in detail.

연구 동기 및 목표

  • ICMI 2018에서 대규모 도전 과제를 통해 비구속적이고 실제 환경에서의 정서 컴퓨팅에 대한 벤치마크를 수립하기 위해.
  • MOOC에서의 학생 참여도 검출을 위한 공개된 데이터셋의 부족을 해결하기 위해, 다양한 조명, 배경 및 기록 조건을 포함한 새로운 다양성 있는 데이터셋을 구축하기 위해.
  • 사회적 상황에서의 집단적 정서 상태에 초점을 맞춘, 시각 데이터로부터의 그룹 수준 정서 인식 연구를 가능하게 하기 위해.
  • 세 가지 상이한 하위 과제에 대해 표준화된 프로토콜, 평가 지표 및 베이스라인을 제공하기 위해.
  • 딥 러닝과 앙상블 방법에 중점을 두어, 다중모달 정서 인식 분야의 혁신을 촉진하기 위해 경쟁을 통해.

제안 방법

  • 기숙사, 식당, 컴퓨터 랩 등 다양한 실제 환경에서 149개의 훈련 영상, 48개의 검증 영상, 67개의 테스트 영상로 구성된 새로운 학생 참여도 데이터셋을 수집하였다.
  • 비디오 프레임에서 눈의 시선과 머리 이동 특징을 OpenFace를 사용해 추출하였으며, 시간적 분석을 위해 25% 겹침을 가진 세그먼트로 다운샘플링 및 세분화하였다.
  • 안면 랜드마크와 시선 포인트의 시간적 시퀀스에 통계적 특징(평균, 표준편차, 왜도, 첨도)을 적용하여 참여도 모델링을 수행하였다.
  • 특히 앙상블 네트워크를 활용한 딥 러닝 모델을 음성-시각 정서 인식 및 그룹 수준의 정서 예측에 적용하였다.
  • 참여도 레이블의 이중 평가자 간 일치도를 평가하기 위해 가중치를 적용한 코헨의 캄파를 사용하였으며, 이는 [0–1] 스케일로 회귀되었다.
  • 정서 및 그룹 수준 정서에 대해서는 분류 정확도를, 참여도 예측에 대해서는 회귀 지표를 사용하여 모델을 평가하였다.

실험 결과

연구 질문

  • RQ1다중모달 신호를 활용하여 비구속적이고 실제 환경에서의 MOOC 시청 상황에서 학생 참여도를 신뢰성 있게 탐지할 수 있는가?
  • RQ2딥 러닝 모델은 '실제 환경' 영상 데이터에서 음성-시각 정서 인식 과제에서 어떤 성능을 보일 수 있는가?
  • RQ3그룹 환경에서의 집단적 정서 상태는 시각적 데이터만으로 정확하게 예측할 수 있는가?
  • RQ4앙상블 딥 러닝 모델은 다중모달 정서 인식 과제에서 기존의 기준 모델 대비 어떻게 비교되는가?
  • RQ5비구속적 환경에서 참여도와 정서를 가장 잘 예측할 수 있는 주요 시각적 및 음성-시각적 특징은 무엇인가?

주요 결과

  • 음성-시각 정서 인식 과제에서 최상위 성능을 기록한 팀은 테스트 세트에서 61.87%의 분류 정확도를 달성하였으며, 기준 모델의 41.07%보다 뚜렷이 높았다.
  • OpenFace를 통해 추출한 눈의 시선과 머리 이동 특징을 활용하여 참여도 예측이 성공적으로 모델링되었으며, 시간적 통계 패턴에 중점을 두었다.
  • 그룹 수준 정서 인식 과제는 시각적 신호만으로도 그룹의 집단적 정서 상태를 중간 정도의 정확도로 추론할 수 있음을 보여주었다.
  • 특히 음성-시각 정서 인식에 대해 앙상블 딥 러닝 모델이 모든 하위 과제에서 가장 높은 성능을 기록하였다.
  • 149개의 훈련 영상에 91명의 참가자가 포함된 새로운 학생 참여도 데이터셋은 다양한 환경 조건을 포함하여 향후 연구에 대한 견고한 벤치마크를 제공한다.
  • 참여도 레이블에 대한 이중 평가자 간 일치도는 중간에서 높은 수준이었으며(가중치 코헨의 캄파), 이는 annotation 프로토콜의 신뢰성을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.