[논문 리뷰] Noise-Resistant Multimodal Transformer for Emotion Recognition
이 논문은 소음에 강한 다중모态 감정 인식을 위한 새로운 아키텍처인 노이즈 저항 다중모달 트랜스포머(NORM-TR)를 제안한다. 이는 노이즈 인식 훈련 방식을 통해 노이즈에 강인한 일반적인 특징(NRGFs)을 학습함으로써 입력에 대한 강인성을 향상시킨다. NRGFs를 쿼리로, 다중모달 특징(MFs)을 키/밸류로 사용하는 융합 트랜스포머를 통해 MOSI, MOSEI, IEMOCAP, RML 데이터셋에서 최신 기술(SOTA) 성능을 달성하며, 정확도와 노이즈 내성 측면에서 뚜렷한 향상을 보였다.
Multimodal emotion recognition identifies human emotions from various data modalities like video, text, and audio. However, we found that this task can be easily affected by noisy information that does not contain useful semantics. To this end, we present a novel paradigm that attempts to extract noise-resistant features in its pipeline and introduces a noise-aware learning scheme to effectively improve the robustness of multimodal emotion understanding. Our new pipeline, namely Noise-Resistant Multimodal Transformer (NORM-TR), mainly introduces a Noise-Resistant Generic Feature (NRGF) extractor and a Transformer for the multimodal emotion recognition task. In particular, we make the NRGF extractor learn a generic and disturbance-insensitive representation so that consistent and meaningful semantics can be obtained. Furthermore, we apply a Transformer to incorporate Multimodal Features (MFs) of multimodal inputs based on their relations to the NRGF. Therefore, the possible insensitive but useful information of NRGF could be complemented by MFs that contain more details. To train the NORM-TR properly, our proposed noise-aware learning scheme complements normal emotion recognition losses by enhancing the learning against noises. Our learning scheme explicitly adds noises to either all the modalities or a specific modality at random locations of a multimodal input sequence. We correspondingly introduce two adversarial losses to encourage the NRGF extractor to learn to extract the NRGFs invariant to the added noises, thus facilitating the NORM-TR to achieve more favorable multimodal emotion recognition performance. In practice, on several popular multimodal datasets, our NORM-TR achieves state-of-the-art performance and outperforms existing methods by a large margin, which demonstrates that the ability to resist noisy information is important for effective emotion recognition.
연구 동기 및 목표
- 다양한 모달(예: 배경 음성, 관련 없는 시각적 자극)에서 발생하는 소음성, 의미적으로 관련 없는 정보가 감정 인식 성능에 악영향을 미치는 문제를 해결하기 위해.
- 어느 모달에서든 노이즈가 존재하더라도 정확한 감정 이해를 유지할 수 있는 강인한 다중모달 융합 프레임워크를 개발하기 위해.
- 입력 시퀀스에 무작위로 주입된 노이즈에 대해 모델이 간접적으로 강인해지도록 훈련하는 노이즈 인식 학습 방식을 설계하기 위해.
- 핵심 감정 의미를 유지하면서 노이즈를 걸러내는 일반적이고 교란에 강인한 표현(NRGFs)을 추출하기 위해.
- MFs를 통해 NRGFs를 보완함으로써 다중모달 융합을 향상시키고, 모달 특화된 정보가 강인성을 강화하도록 보장하기 위해.
제안 방법
- 노이즈 인식 학습 방식을 활용하여 노이즈에 강인한 표현을 학습하는 노이즈 저항 일반 특징(NRGF) 추출기를 도입한다.
- NRGFs를 쿼리로, 음성, 영상, 텍스트에서 유도된 다중모달 특징(MFs)을 키 및 밸류로 사용하는 다중모달 융합 트랜스포머를 적용하여 맥락 인식 융합을 가능하게 한다.
- 훈련 중 입력 시퀀스에 무작위 마스킹 또는 노이즈 주입을 적용하여 모든 또는 특정 모달에서 실제 세계의 노이즈를 시뮬레이션한다.
- NRGFs의 노이즈에 대한 불변성을 강제하기 위해 두 가지 적대적 손실을 적용하여 추론 시 강인성을 향상시킨다.
- 커널 밀도 추정(KDE)과 코사인 유사도를 사용하여 다양한 훈련 제도에서 NRGFs 및 MFs의 분포를 시각화하고 분석한다.
- 초파rameter 튜닝을 통해 모델 성능을 최적화하며, 입력 시퀀스 길이(최적의 정확도를 위해 8 프레임로 설정)와 어텐션 메커니즘 설계를 포함한다.
실험 결과
연구 질문
- RQ1노이즈에 강인한 표현을 명시적으로 학습함으로써 다중모달 트랜스포머 모델이 노이즈 입력에 대해 향상된 강인성을 달성할 수 있는가?
- RQ2융합 트랜스포머에서 NRGFs를 쿼리로 사용할 경우, 표준 다중모달 융합 대비 감정 인식 정확도가 어떻게 향상되는가?
- RQ3노이즈 인식 학습 방식이 모델의 노이즈 조건 하에서의 일반화 능력을 어느 정도 향상시키는가?
- RQ4노이즈 인식 학습 방식 유무에 따라 NRGFs 및 MFs의 분포는 어떻게 변화하며, 이는 특징의 강인성에 어떤 의미를 갖는가?
- RQ5융합 트랜스포머의 어텐션 메커니즘이 마스킹(노이즈 있는) 프레임보다 깨끗한 프레임을 선호하는가? 이는 효과적인 노이즈 억제를 의미하는가?
주요 결과
- NORM-TR은 MOSI, MOSEI, IEMOCAP, RML 데이터셋에서 최신 기술(SOTA) 성능을 달성하며, 기존 방법들에 비해 크게 뛰어난 성능을 보였다.
- 입력 시퀀스 길이를 8 프레임로 설정했을 때 MOSI 데이터셋에서 88.89%의 정확도를 기록했으며, 32 프레임로 늘어나면서 노이즈 누적로 인해 성능이 급격히 떨어졌다.
- 시각화 결과, 노이즈 인식 학습 방식이 적용된 경우 NRGFs 간 유사도는 약 1에 가까워졌고, NRGFs와 MFs 간 유사도는 약 0에 가까워져 강인성과 모달 특이성을 확인할 수 있었다.
- 융합 트랜스포머의 어텐션 웨이트는 마스킹된(노이즈 있는) 프레임에서 크게 감소하여, 모델이 깨끗하고 정보가 풍부한 입력을 선호함을 확인했다.
- 노이즈 인식 학습 방식은 노이즈가 주입된 입력에서 추출된 NRGFs 간의 유사도를 효과적으로 감소시켜, NRGFs가 더 일반적이고 노이즈에 강인한 특징으로 변모함을 증명했다.
- 이 방법은 명시적 노이즈 주입뿐만 아니라 암묵적인 실세계 노이즈까지도 효과적으로 다루는 강력한 일반화 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.