Skip to main content
QUICK REVIEW

[논문 리뷰] Continuous Multimodal Emotion Recognition Approach for AVEC 2017

Narotam Singh, Nittin D. Singh|arXiv (Cornell University)|2017. 09. 18.
Music and Audio Processing참고 문헌 22인용 수 4
한 줄 요약

이 논문은 AVEC 2017에 대응하는 연속 다모odal 정서 인식 시스템을 제안하며, 음성 및 시각적 특징—HOG, SIFT-GMM 피셔 벡터, VGG-Face, ResNet-50 특징—을 신경망 회귀를 통해 융합한다. 최고의 다모달 융합은 개발 세트에서 각각 각성에 대해 0.525, 정서에 대해 0.507의 공차상관계수(CCC)를 기록했으며, 단모달 모델을 능가했지만, 테스트 세트에서는 성능이 낮아 과적합 또는 도메인 이동의 가능성을 시사한다.

ABSTRACT

This paper reports the analysis of audio and visual features in predicting the continuous emotion dimensions under the seventh Audio/Visual Emotion Challenge (AVEC 2017), which was done as part of a B.Tech. 2nd year internship project. For visual features we used the HOG (Histogram of Gradients) features, Fisher encodings of SIFT (Scale-Invariant Feature Transform) features based on Gaussian mixture model (GMM) and some pretrained Convolutional Neural Network layers as features; all these extracted for each video clip. For audio features we used the Bag-of-audio-words (BoAW) representation of the LLDs (low-level descriptors) generated by openXBOW provided by the organisers of the event. Then we trained fully connected neural network regression model on the dataset for all these different modalities. We applied multimodal fusion on the output models to get the Concordance correlation coefficient on Development set as well as Test set.

연구 동기 및 목표

  • AVEC 2017 챌린지에 대응하는 연속 정서 인식 시스템을 개발하기 위해 다모달 음성 및 시각적 특징을 활용한다.
  • 수작업 시각적 특징(HOG, SIFT-GMM)과 딥러닝 기반 특징(VGG-Face, ResNet-50)이 연속 정서 차원을 예측하는 데 얼마나 효과적인지 평가한다.
  • 다모달 융합이 각성, 정서 및 선호도 예측을 위한 회귀 성능에 미치는 영향을 조사한다.
  • 개발 세트와 테스트 세트에서 단모달 및 다모달 모델 간의 공차상관계수(CCC)를 비교한다.

제안 방법

  • 경사도 히스토GRAM을 사용해 영상 프레임의 얼굴 영역에서 HOG 특징을 추출한다.
  • SIFT 특징을 계산한 후 GMM 기반 피셔 벡터 인코딩을 통해 시간적 모델링을 수행하고, 차원 감소를 위해 PCA를 적용하여 4508차원으로 축소한다.
  • 미리 훈련된 VGG-Face 및 ResNet-50-dag 모델을 사용하여 각각 35번째 및 174번째 레이어의 활성화를 추출해 깊이 있는 시각적 특징으로 활용한다.
  • 23개의 저수준 기술적 특징(LLD)에서 6초 블록 크기로 훈련하기 위해 openXBOW를 사용해 음성 Bag-of-audio-words(BoAW) 표현을 생성한다.
  • 각성, 정서 및 선호도의 회귀를 위해 ReLU 활성화를 사용한 완전 연결 피드포워드 신경망을 훈련한다(출력층 제외).
  • 단모달 예측 결과를 조기 또는 후기 융합 전략을 통해 융합하고, 개발 세트 및 테스트 세트에서 CCC를 통해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1수작업 시각적 특징(HOG, SIFT-GMM)이 깊이 있는 학습 기반 특징(VGG-Face, ResNet-50)보다 연속 정서 차원 예측에 얼마나 효과적인가?
  • RQ2음성 전용 특징(저수준 기술적 특징의 BoAW)이 각성, 정서 및 선호도 예측에 시각적 및 다모달 모델 대비 얼마나 성능이 좋은가?
  • RQ3음성 및 시각적 특징의 다모달 융합이 AVEC 2017 데이터셋에서 단모달 기반 모델 대비 회귀 성능을 향상시키는가?
  • RQ4모델 복잡도(예: 더 깊은 네트워크)가 연속 정서 회귀에서 성능과 계산 비용에 어떤 영향을 미치는가?
  • RQ5융합 과정에서 특징별 가중치가 다양한 정서 차원 예측에 얼마나 영향을 미치는가?

주요 결과

  • 다모달 융합 모델은 개발 세트에서 가장 높은 CCC를 기록했으며, 각성에 대해 0.525, 정서에 대해 0.507이었다. 이는 단모달 모델을 능가했다.
  • HOG 특징는 시각적 특징 중에서 가장 높은 단모달 성능를 기록했으며, 개발 세트에서 각성에 대해 0.289, 정서에 대해 0.310의 CCC를 기록했다.
  • VGG-Face 특징는 각성에 대해 0.277, 정서에 대해 0.336의 CCC를 기록했으며, ResNet-50 특징(각각 0.165 및 0.274)을 능가했다.
  • SIFT-GMM 피셔 벡터는 성능이 열악했으며, 각성에 대해 0.075, 정서에 대해 0.123의 CCC를 기록해 이 설정에서 분류 능력이 제한적임을 시사했다.
  • 테스트 세트에서는 다모달 모델이 각성에 대해 0.306, 정서에 대해 0.466의 CCC를 기록했으며, 개발 세트 대비 성능 저하가 뚜렷하게 나타났다.
  • 테스트 세트의 다모달 모델에 대한 선형 상관계수는 각성에 대해 0.361, 정서에 대해 0.437이었으며, 낮은 CCC에도 불구하고 중간 정도의 예측 능력을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.