Skip to main content
QUICK REVIEW

[논문 리뷰] $M^3$T: Multi-Modal Continuous Valence-Arousal Estimation in the Wild

Yuanhang Zhang, Rulin Huang|arXiv (Cornell University)|2020. 02. 07.
Speech and Audio Processing참고 문헌 23인용 수 6
한 줄 요약

이 논문은 영상과 음성 신호를 사용하여 자연스러운 환경에서 연속적인 평가-각성 추정을 위한 다중모달 다중작업 프레임워크인 $M^{3}$T를 제안한다. 3D CNN을 활용해 시공간적 시각적 특징을 추출하고, 순차적 모델링을 위해 이중방향 RNN을 사용하며, 정서 인식과 얼굴 행동 단위 검출을 보조 작업으로 통합하여 ABAW 2020 검증 세트에서 평균 일致상관계계수( CCC ) 0.44를 달성하였으며, 이는 이전 방법들보다 뚜렷이 뛰어난 성능이다.

ABSTRACT

This report describes a multi-modal multi-task ($M^3$T) approach underlying our submission to the valence-arousal estimation track of the Affective Behavior Analysis in-the-wild (ABAW) Challenge, held in conjunction with the IEEE International Conference on Automatic Face and Gesture Recognition (FG) 2020. In the proposed $M^3$T framework, we fuse both visual features from videos and acoustic features from the audio tracks to estimate the valence and arousal. The spatio-temporal visual features are extracted with a 3D convolutional network and a bidirectional recurrent neural network. Considering the correlations between valence / arousal, emotions, and facial actions, we also explores mechanisms to benefit from other tasks. We evaluated the $M^3$T framework on the validation set provided by ABAW and it significantly outperforms the baseline method.

연구 동기 및 목표

  • 자연스럽고 제약 없는 영상 환경에서 다중모달 및 다중작업 학습을 활용하여 연속적인 평가-각성 추정을 향상시키는 것.
  • 분류 정서 인식과 얼굴 행동 단위 검출과 같은 보조 작업이 평가 및 각성 추정 성능에 어떻게 기여하는지 조사하는 것.
  • 후기 융합 및 주의 메커니즘을 사용한 시각적 및 청각적 특징의 조기 융합의 효과성을 탐색하는 것.
  • 3D 컨볼루션 네트워크 기반 모델을 대규모 영상 데이터셋(예: VoxCeleb2)에서 미리 훈련시켜 종합 감정 인식에 대한 엔드 투 엔드 성능 향상 여부를 평가하는 것.
  • Aff-Wild2 데이터셋을 사용하여 다중모달 연속 감정 추정에 대한 강력한 베이스라인을 수립하는 것.

제안 방법

  • 영상 클립에서 시공간적 시각적 특징을 추출하기 위해 3D VGG 유사 백본을 사용하며, 평가 및 각성에 대해 별도의 브랜치를 운영한다.
  • 정서 인식 및 얼굴 행동 단위 검출을 위한 사전 훈련된 모델의 2D 정적 특징을 연결하여 시각적 특징을 향상시킨다.
  • 추출된 시각적 특징의 장기적 시간적 의존성을 모델링하기 위해 이중방향 GRU를 사용한다.
  • 청각적 특징은 별도의 음성 하위네트워크를 통해 추출되며, 회귀를 위해 GRU와 완전 연결층을 활용한다.
  • 최종 예측 이전에 시각적 및 청각적 특징을 연결하거나 주의 메커니즘을 사용하여 후기 융합을 적용한다.
  • 다중작업 손실을 사용하여 모델을 훈련시며, 평가 및 각성에 대해 평균 제곱오차, 정서 인식에 대해 교차 엔트로피를 사용한다.

실험 결과

연구 질문

  • RQ1분류 정서 인식 및 얼굴 행동 단위 검출과 같은 보조 작업이 연속적인 평가-각성 추정 성능을 향상시키는가?
  • RQ2시각적 및 청각적 모odal 특징의 융합은 자연스러운 환경에서 감정 추정 성능 향상에 얼마나 효과적인가?
  • RQ3대규모 영상 데이터셋(예: VoxCeleb2)에서 3D 컨볼루션 네트워크를 미리 훈련시키면 Aff-Wild2 벤치마크에서 성능 향상이 이루어지는가?
  • RQ4주목적 기반 융합은 단순 연결보다 다중모달 감정 추정에서 우월한가?
  • RQ5다양한 특징 융합 전략(예: 연결 vs. 주의)이 평가 및 각성 예측의 최종 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 $M^{3}$T 프레임워크는 ABAW 2020 검증 세트에서 평균 일치상관계수( CCC ) 0.44를 달성하였으며, 이는 기준 방법보다 뚜렷이 뛰어난 성능이다.
  • 모델은 각성 추정에서 CCC 0.55를 기록하여 이 차원에서 뛰어난 성능를 보였으며, 이는 3D 컨볼루션을 통한 시간적 동역학의 효과적인 모델링 때문일 가능성이 높다.
  • VoxCeleb2에서 3D 백본을 미리 훈련시키면 성능 향상이 이루어졌으며, 미리 훈련한 경우 평균 CCC 0.42를 기록한 반면, 초기화부터 훈련한 경우 0.40이었다.
  • 연결을 통한 청각-시각 융합은 주의 기반 융합보다 더 좋은 결과를 보였으며( CCC = 0.44 vs. CCC = 0.42), 이는 훈련 시간이 부족했을 가능성이 있다.
  • 우울성 분지에서 AU 특징 대신 SENet-101 특징을 사용한 결과 더 뛰어난 성능를 기록하였으며, 이는 우울성과의 강한 상관관계를 시사한다.
  • 모델는 청각 및 영상 신호를 융합할 경우 각성 추정에 뚜렷한 향상이 이루어지지만, 평가 추정에는 영향을 주지 않는 것으로 나타났으며, 이는 이전 연구 결과와 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.