[논문 리뷰] Multimodal Fusion with Deep Neural Networks for Audio-Video Emotion Recognition
오디오, 비디오, 텍스트의 엔드투엔드 멀티모달 융합을 위한 새로운 심층 신경망으로 연속 감정 예측 수행, AVEC SEWA 데이터에서 초기/후기 융합 베이스라인보다 CCC가 더 높게 나타냄.
This paper presents a novel deep neural network (DNN) for multimodal fusion of audio, video and text modalities for emotion recognition. The proposed DNN architecture has independent and shared layers which aim to learn the representation for each modality, as well as the best combined representation to achieve the best prediction. Experimental results on the AVEC Sentiment Analysis in the Wild dataset indicate that the proposed DNN can achieve a higher level of Concordance Correlation Coefficient (CCC) than other state-of-the-art systems that perform early fusion of modalities at feature-level (i.e., concatenation) and late fusion at score-level (i.e., weighted average) fusion. The proposed DNN has achieved CCCs of 0.606, 0.534, and 0.170 on the development partition of the dataset for predicting arousal, valence and liking, respectively.
연구 동기 및 목표
- 다중 모달리티(오디오, 비디오, 텍스트)를 사용하여 실제 환경에서 강건한 감정 인식을 촉진한다.
- 모듈레이션별 표현과 융합 표현을 함께 학습하는 DNN를 설계한다.
- AVEC SEWA/RECOLA 데이터셋에서 조기 융합(특징 수준) 및 후기 융합(점수 수준) 베이스라인과 제안된 아키텍처를 비교 평가한다.
제안 방법
- discriminant 표현을 학습하기 위해 독립적인 모달리티별 계층을 갖춘 DNN을 제안한다.
- 모달리티 표현을 융합하기 위한 연결(concatenation) 기반 병합 계층을 사용하고, 이어서 완전 연결층과 회귀층을 둔다.
- 회귀를 위한 단일 선형 뉴런과 예측과 라벨의 규모를 맞추는 스케일링 모듈을 활용한다.
- Mean Squared Error 손실로 학습하고 최적 모델 선정을 위해 Keras 체크포인팅을 사용한다.
- CCC를 향상시키기 위한 여러 후처리 스케일링(min-max, 표준편차 비율, 소수점 스케일링)을 탐색한다.
- 아로usal, valence, liking 차원별로 별도의 아키텍처를 사용하여 평가한다.
실험 결과
연구 질문
- RQ1하이브리드 DNN 아키텍처가 연속 감정 예측을 위한 모달리티별 표현과 공동 융합을 효과적으로 학습할 수 있는가?
- RQ2엔드 투 엔드 멀티모달 융합이 현실 조건에서 전통적인 조기(특징 수준) 및 후기(점수 수준) 융합을 능가하는가?
- RQ3전처리 및 후처리 단계(지연 보상, 스케일링)가 arousal, valence, liking의 CCC에 어떤 영향을 미치는가?
- RQ4제안된 아키텍처가 오디오, 비디오, 텍스트 모달리티 각각 및 융합에서 어떻게 수행되는가?
- RQ5피드포워드 융합을 넘어 정확도를 더 높이기 위한 시계열 모델링(예: 순환 구성요소)이 필요한가?
주요 결과
- 제안된 DNN이 AVEC SEWA에서 최첨단 조기 및 후기 융합 베이스라인보다 CCC를 더 높게 달성한다.
- 제안된 융합 아키텍처의 개발 세트 CCC는 arousal 및 liking에서 최대 0.606, valence에서 0.534에 도달했다.
- 텍스트 모달리티는 특히 liking에 대해 매우 정보량이 많으며, 단일 소스에 의존하기보다 모달리티를 결합한 융합이 이점이 있다.
- 지연 보상 및 후처리 스케일링은 CCC에 크게 영향을 미치며, 최적 지연(아로usal/valence 1.5초, liking 2.5초)이 성능을 향상시킨다.
- 아키텍처는 특징, 분류기 및 융합 함수의 엔드 투 엔드 최적화를 가능하게 하여 개발 데이터에서 단일 모듀얼 및 조기/후기 융합 베이스라인을 능가한다.
- 테스트 세트 결과는 과적합으로 인한 하락 가능성을 시사하며, 추가 시계열 모델링 또는 규제화가 필요하다는 제안이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.