[논문 리뷰] A vector quantized masked autoencoder for audiovisual speech emotion recognition
이 논문은 음성 및 영상의 이산 표현을 사전 훈련된 벡터 양자화 변동 자동부호화기(VQ-VAEs)에서 추출한 후, 마스크된 시공간 및 스펙트로시계적 토큰을 복원하기 위해 마스크된 자동부호화기(MAE)를 활용하는 자기지도 학습 기반의 음성영상 감정 인식 모델인 VQ-MAE-AV를 제안한다. VoxCeleb2에서 사전 훈련하고 표준 SER 데이터셋에서 미세조정한 결과, 이중 모odal 복원 및 공동 표현 학습을 통해 최신의 지도 학습 방법을 능가하는 성능을 보였다.
An important challenge in emotion recognition is to develop methods that can leverage unlabeled training data. In this paper, we propose the VQ-MAE-AV model, a self-supervised multimodal model that leverages masked autoencoders to learn representations of audiovisual speech without labels. The model includes vector quantized variational autoencoders that compress raw audio and visual speech data into discrete tokens. The audiovisual speech tokens are used to train a multimodal masked autoencoder that consists of an encoder-decoder architecture with attention mechanisms. The model is designed to extract both local (i.e., at the frame level) and global (i.e., at the sequence level) representations of audiovisual speech. During self-supervised pre-training, the VQ-MAE-AV model is trained on a large-scale unlabeled dataset of audiovisual speech, for the task of reconstructing randomly masked audiovisual speech tokens and with a contrastive learning strategy. During this pre-training, the encoder learns to extract a representation of audiovisual speech that can be subsequently leveraged for emotion recognition. During the supervised fine-tuning stage, a small classification model is trained on top of the VQ-MAE-AV encoder for an emotion recognition task. The proposed approach achieves state-of-the-art emotion recognition results across several datasets in both controlled and in-the-wild conditions.
연구 동기 및 목표
- 자신의지도 학습 기반의 음성영상 감정 인식(SER)에서 레이블이 부족한 문제를 해결하기 위해 자기지도 사전 훈련을 활용한다.
- 사전 훈련된 VQ-VAEs에서 유도된 이산 음성 및 영상 토큰을 조합하여 다중 모달 표현 학습을 향상시킨다.
- 시공간 및 스펙트로시계적 토큰을 마스크하고 복원하는 데 특화된 마스크된 자동부호화기 아키텍처를 개발한다.
- 다중 모달 복원이 최종 SER 성능 향상에 기여하는지 평가한다.
- 톂나이제이션 파라미터(h, w, d)가 모델 성능에 미치는 영향을 조사한다.
제안 방법
- 모델은 원시 음성 및 영상 입력에서 이산 표현을 추출하기 위해 두 개의 사전 훈련된 VQ-VAEs를 사용한다.
- 음성 및 영상 표현은 겹치지 않는 시공간(영상) 및 스펙트로시계적(음성) 토큰으로 나뉜다.
- 마스크된 자동부호화기 아키텍처를 적용하여 75%의 이산 토큰을 마스크하고, 가시 토큰들만을 사용해 복원한다.
- 에코더는 가시 토큰을 처리하고 잠재 표현을 생성하며, 경량 디코더는 마스크된 토큰을 복원한다.
- 이중 모달 토큰의 복원 손실을 사용해 VoxCeleb2 데이터셋에서 사전 훈련하고, 감정 기반 음성영상 SER 데이터셋에서 미세조정한다.
- 시간 축을 따라 입체 마스크 전략을 사용하며, 높은 마스크 비율(최대 90%)을 적용해 강건한 표현 학습을 유도한다.
실험 결과
연구 질문
- RQ1VQ-VAEs에서 유도된 이산 음성 및 영상 표현은 음성영상 SER를 위한 다중 모달 자기지도 학습에 기여하는가?
- RQ2VQ-MAE-AV 모델은 표준 음성영상 SER 벤치마크에서 최신 지도 학습 방법과 비교해 성능이 뛰어나나?
- RQ3다른 토큰화 파라미터(h, w, d)는 모델의 감정 인식 정확도에 어떤 영향을 미치는가?
- RQ4모델은 교차 모달 정보를 활용해 마스크된 음성 또는 영상 콘텐츠를 어느 정도 복원할 수 있는가?
- RQ5공동 다중 모달 복원은 단일 모달 복원보다 더 나은 최종 SER 성능을 이끌어내는가?
주요 결과
- VQ-MAE-AV 모델은 VoxCeleb2에서 사전 훈련하고 표준 데이터셋에서 미세조정한 후, 최신의 지도 학습 기반 음성영상 SER 방법을 능가한다.
- 90% 마스크 비율에서, VQ-MAE-AV는 단일 모달 모델 대비 영상 복원에서 PSNR 3.68 dB 향상되고 음성 복원에서 SDR 2.87 dB 향상된다.
- 음성은 완전히 마스크된 상태(100% 마스크)에서도 시각적 입술 움직임만을 기반으로 발음과 말 구조를 성공적으로 복원한다.
- 최적의 토큰화 파라미터는 음성 및 영상 모달 모두에서 h = w = 4 및 d = 4로, 성능과 계산 비용의 균형을 이룬다.
- 다중 모달 복원이 표현 품질을 크게 향상시킨다는 것이 재현 성능 및 최종 SER 정확도에서 입증된다.
- 제거 실험 결과, 고마스크 비율에서 공동 다중 모달 학습이 단일 모달 대비 성능 향상을 보임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.