[논문 리뷰] The MuSe 2021 Multimodal Sentiment Analysis Challenge: Sentiment, Emotion, Physiological-Emotion, and Stress
이 논문은 음성-시각적, 텍스트적, 생물학적 신호를 사용하여 연속적이고 범주형 정서/감정 예측, 생리적-감정 인식, 스트레스 탐지에 중점을 둔 MuSe 2021 멀티모달 정서 분석 챌린지를 제시한다. MuSe-CaR 및 Ulm-TSST 데이터셋을 사용하여, 기준 모델인 LSTM 기반 다모달 융합 모델이 생리적-감정 예측에서 테스트 CCC 0.4908을 기록하여 저수준 생리적 신호와 정서 상태를 통합하는 데의 과제를 드러냈다.
Multimodal Sentiment Analysis (MuSe) 2021 is a challenge focusing on the tasks of sentiment and emotion, as well as physiological-emotion and emotion-based stress recognition through more comprehensively integrating the audio-visual, language, and biological signal modalities. The purpose of MuSe 2021 is to bring together communities from different disciplines; mainly, the audio-visual emotion recognition community (signal-based), the sentiment analysis community (symbol-based), and the health informatics community. We present four distinct sub-challenges: MuSe-Wilder and MuSe-Stress which focus on continuous emotion (valence and arousal) prediction; MuSe-Sent, in which participants recognise five classes each for valence and arousal; and MuSe-Physio, in which the novel aspect of `physiological-emotion' is to be predicted. For this years' challenge, we utilise the MuSe-CaR dataset focusing on user-generated reviews and introduce the Ulm-TSST dataset, which displays people in stressful depositions. This paper also provides detail on the state-of-the-art feature sets extracted from these datasets for utilisation by our baseline model, a Long Short-Term Memory-Recurrent Neural Network. For each sub-challenge, a competitive baseline for participants is set; namely, on test, we report a Concordance Correlation Coefficient (CCC) of .4616 CCC for MuSe-Wilder; .4717 CCC for MuSe-Stress, and .4606 CCC for MuSe-Physio. For MuSe-Sent an F1 score of 32.82 % is obtained.
연구 동기 및 목표
- 실생활 및 스트레스 상황에서 음성-시각적, 텍스트적, 생물학적 신호 모odal을 통합함으로써 멀티모달 정서 및 감정 분석을 발전시키기 위해.
- EDA와 각성도 애너테이션을 융합한 새로운 하위 챌린지를 도입함으로써 생리적-감정 인식의 격차를 해소하기 위해.
- MuSe-CaR 및 Ulm-TSST 데이터셋을 사용하여 투명하고 오픈소스 기반의 특징 추출 및 기준 모델을 제공함으로써 표준화된 벤치마크를 마련하기 위해.
- 통합되고 명확히 정의된 챌린지 프레임워크를 통해 정서 컴퓨팅, 정서 분석 및 헬스 인포매틱스 분야 간 협업을 촉진하기 위해.
제안 방법
- 이 챌린지는 두 가지 데이터셋을 사용한다: 실제 사용자가 생성한 차량 리뷰를 위한 MuSe-CaR와 스트레스 유도 테리 사회적 스트레스 테스트 시나리오를 위한 Ulm-TSST.
- 평가자 일치 애너테이션 가중치(Rater Aligned Annotation Weighting, RAAW)는 평가자 간 일치도와 반응 시간 정렬을 고려하여 연속 감정 애너테이션을 융합하는 데 사용된다.
- 모든 하위 챌린지의 기준 모델로 장기 기억망(Long Short-Term Memory, LSTM) 기반 순환 신경망을 사용하며, 음성, 시각, 텍스트 특징을 후기 융합한다.
- 각 모달리티에서 최신 기술 기반 특징을 추출한다: 음성은 DeepSpectrum, 영상은 VGGface, 텍스트는 BERT, 생물학적 신호는 1kHz에서의 원시 신호(EDA, ECG, RESP, BPM)를 사용한다.
- 생리적-감정 예측의 경우, RAAW를 사용해 EDA와 각성도를 융합하고, 모델은 연속적인 생리적-각성 수준을 예측한다.
- 기준 성능은 회귀 과제에 대해 공창상관계수(Concordance Correlation Coefficient, CCC)와 분류 과제에 대해 F1 점수로 평가되며, 엄격한 훈련/검증/테스트 분할을 적용한다.
실험 결과
연구 질문
- RQ1음성, 시각, 텍스트 신호를 사용하여 실생활의 자연스러운 비디오 리뷰에서 연속적인 밸런스와 각성도를 예측하는 멀티모달 모델의 성능은 어떠한가?
- RQ2EDA와 같은 생리적 신호는 전통적 모달리티에 비해 고스트레스 상황에서 감정 및 스트레스 인식 정확도를 향상시킬 수 있는가?
- RQ3멀티모달 환경에서 음성, 영상, 텍스트, 생물학적 신호가 연속적 및 범주형 정서 상태 예측에 기여하는 상대적 기여도는 어떠한가?
- RQ4평가자 일치 애너테이션 가중치(Rater Aligned Annotation Weighting, RAAW)는 다양한 데이터셋에서 연속 감정 애너테이션의 품질과 신뢰도를 어떻게 향상시키는가?
- RQ5오픈소스 기반의 투명한 특징 추출 파ip라인을 사용할 때, 단순한 LSTM 기반 융합 모델이 멀티모달 정서 인식에서 뛰어난 성능을 달성할 수 있는가?
주요 결과
- 기준 모델은 연속 감정 예측을 위한 MuSe-Wilder 하위 챌린지에서 테스트 공창상관계수(Concordance Correlation Coefficient, CCC) 0.4616을 기록했다.
- MuSe-Sent 분류 과제에서 기준 모델은 테스트 세트에서 F1 점수 32.82%를 기록했으며, 시각과 텍스트의 후기 융합이 가장 높은 성능를 보였다.
- MuSe-Stress 하위 챌린지에서 가장 우수한 모델은 테스트 세트에서 CCC 0.5088을 기록했으며, 음성과 시각 특징의 후기 융합이 개별 모달리티보다 뛰어난 성능를 보였다.
- 새로운 MuSe-Physio 하위 챌린지에서 가장 우수한 기준 모델은 최고의 음성(DeepSpectrum)과 시각(VGGface) 특징을 융합하여 테스트 세트에서 CCC 0.4908을 기록했다.
- 텍스트 특징(BERT)는 음성 및 시각 특징에 비해 유의미하게 열등했으며, MuSe-Physio에서 개발 세트에서는 0.2583 CCC, 테스트 세트에서는 0.1604 CCC를 기록했다.
- 생물학적 신호만을 사용할 경우, 4층 LSTM을 적용하여 생리적-감정 예측에서 테스트 세트에서 CCC 0.3328을 기록했으며, 향후 향상 가능성을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.