Skip to main content
QUICK REVIEW

[논문 리뷰] Feature-level and Model-level Audiovisual Fusion for Emotion Recognition in the Wild

Jie Cai, Zibo Meng|arXiv (Cornell University)|2019. 06. 06.
Emotion and Mood Recognition참고 문헌 53인용 수 8
한 줄 요약

이 논문은 음성(OpenSmile)과 시각적 특징(LBP-TOP, CNN 앙상블, CNN-BLSTM)을 사용하여 자연 환경에서의 정서 인식을 위한 두 가지 오디오비주얼 융합 전략—특징 수준 융합과 모델 수준 융합—을 제안한다. EmotiW2018 AFEW 데이터셋에서 두 방법 모두 단모달 기준선을 크게 능가하며, 특징 수준 융합은 테스트 정확도 56.81%를 기록했고, 모델 수준 융합은 한 모odal이 실패할 경우에도 강건성을 보였다.

ABSTRACT

Emotion recognition plays an important role in human-computer interaction (HCI) and has been extensively studied for decades. Although tremendous improvements have been achieved for posed expressions, recognizing human emotions in "close-to-real-world" environments remains a challenge. In this paper, we proposed two strategies to fuse information extracted from different modalities, i.e., audio and visual. Specifically, we utilized LBP-TOP, an ensemble of CNNs, and a bi-directional LSTM (BLSTM) to extract features from the visual channel, and the OpenSmile toolkit to extract features from the audio channel. Two kinds of fusion methods, i,e., feature-level fusion and model-level fusion, were developed to utilize the information extracted from the two channels. Experimental results on the EmotiW2018 AFEW dataset have shown that the proposed fusion methods outperform the baseline methods significantly and achieve better or at least comparable performance compared with the state-of-the-art methods, where the model-level fusion performs better when one of the channels totally fails.

연구 동기 및 목표

  • 시각적 및 음성 모달이 변동성이 큰 실생활 환경에서 정서를 인식하는 데 도전하는 문제를 해결한다.
  • 다양한 딥 러닝 및 수작업 특징 표현으로부터 오디오 및 시각적 특징을 효과적으로 융합하여 정서 인식 성능을 향상시킨다.
  • 모달 실패에 대응하고 음성 및 영상 신호 간의 시간적 비일치성과 스케일 차이를 다룰 수 있는 융합 전략을 개발한다.
  • EmotiW2018 AFEW 데이터셋에서 제안된 융합 방법을 최신 기법들과 비교하여 우수성과 강건성을 입증한다.

제안 방법

  • 면상 시퀀스에서 LBP-TOP, CNN 앙상블, 양방향 LSTM(CNN-BLSTM)를 사용하여 시각적 특징을 추출한다.
  • OpenSmile 툴킷을 사용하여 음성 특징을 추출하며, 주로 피치, 에너지, 멜 주파수 해상도 계수(Mel-Frequency Cepstrum Coefficients) 등의 프로소디적 및 스펙트럼 특징에 중점을 둔다.
  • 특징 수준 융합을 통해 오디오 특징과 세 가지 유형의 시각적 특징을 결합하여 단일 통합 특징 벡터를 생성하고, 이를 분류에 활용한다.
  • 모델 수준 융합을 위해 베이지안 네트워크를 사용하여 단모달 인식 결과를 확률적으로 통합하며, 측정 불확실성과 시간적 비일치성을 고려한다.
  • 일반화 성능 향상을 위해 무작위 자르기, 회전(-5°에서 5°), 수평 뒤집기 등의 데이터 증강 기법을 적용한다.
  • 표준 검증 및 테스트 분할을 사용하여 EmotiW2018 AFEW 데이터셋에서 모델을 훈련하고 평가하며, 일곱 가지 정서의 평균 정확도로 성능을 측정한다.

실험 결과

연구 질문

  • RQ1특징 수준 융합을 통해 다양한 시각적 특징과 오디오 특징을 융합하면, 단모달 기준선 대비 자연 환경에서 정서 인식 정확도가 향상되는가?
  • RQ2베이지안 네트워크와 같은 확률적 프레임워크를 사용한 모델 수준 융합은 한 모달이 실패하거나 성능이 열 劣할 경우 정확도를 향상시키는 데 효과적인가?
  • RQ3제안된 융합 방법들은 EmotiW2018 AFEW 데이터셋에서 평균 정확도 및 클래스별 정확도 측면에서 최신 기법들과 비교해 어떻게 성능을 내는가?
  • RQ4어느 정도의 융합 전략이 혐오, 공포, 놀람과 같이 개별 특징으로는 잘 포착되지 않는 어려운 정서의 인식을 향상시키는가?

주요 결과

  • 특징 수준 융합은 56.81%의 최고 테스트 정확도를 기록하여, 모든 단모달 기준선 및 대부분의 최신 기법을 뛰어넘었다.
  • 모델 수준 융합은 54.06%의 테스트 정확도를 달성했으며, 특히 혐오, 공포, 놀람과 같은 어려운 정서에서 검증 세트에서 뛰어난 강건성을 보였다.
  • CNN-BLSTM 시각적 특징 추출기의 성능은 LBP-TOP 및 단독 CNN보다 뛰어나 검증 세트에서 49.09%의 정확도를 기록하여 시간적 모델링의 이점을 입증했다.
  • 두 융합 방법 모두 단모달 기준선 대비 평균 인식 성능을 향상시켰으며, 특히 특징 수준 융합이 테스트 세트에서 가장 큰 성과를 보였다.
  • 모델 수준 융합은 확률적 통합을 통해 불확실성과 모달 고유의 오차를 고려함으로써 어려운 정서 인식에 특별히 효과적이었다.
  • 다시 말해, 혐오, 공포, 놀람의 인식은 여전히 어려운 과제로 남아 있었으며, 모든 단모달 기준선의 정확도가 50% 이하였고, 이는 이러한 클래스에 대한 더 나은 특징 표현이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.