Skip to main content
QUICK REVIEW

[논문 리뷰] Attention-Augmented End-to-End Multi-Task Learning for Emotion Prediction from Speech

Zixing Zhang, Bingwen Wu|arXiv (Cornell University)|2019. 03. 29.
Emotion and Mood Recognition참고 문헌 25인용 수 8
한 줄 요약

이 논문은 자극성, 정서적 강도, 지배성의 세 가지 감정 차원을 함께 학습하는 엔드 투 엔드 다중 작업 학습 프레임워크를 제안하며, 자기주의 주의(self-attention)를 통합하여 음성 감정 예측을 수행한다. 보조 작업과 주의 메커니즘을 통합함으로써 표현의 강건성과 작업별 특징 가중치를 향상시켜, IEMOCAP 데이터셋에서 기준 모델 대비 성능 향상을 이룩하였으며, 특히 정서적 강도와 지배성 예측에서 두드러진 성과를 보였다.

ABSTRACT

Despite the increasing research interest in end-to-end learning systems for speech emotion recognition, conventional systems either suffer from the overfitting due in part to the limited training data, or do not explicitly consider the different contributions of automatically learnt representations for a specific task. In this contribution, we propose a novel end-to-end framework which is enhanced by learning other auxiliary tasks and an attention mechanism. That is, we jointly train an end-to-end network with several different but related emotion prediction tasks, i.e., arousal, valence, and dominance predictions, to extract more robust representations shared among various tasks than traditional systems with the hope that it is able to relieve the overfitting problem. Meanwhile, an attention layer is implemented on top of the layers for each task, with the aim to capture the contribution distribution of different segment parts for each individual task. To evaluate the effectiveness of the proposed system, we conducted a set of experiments on the widely used database IEMOCAP. The empirical results show that the proposed systems significantly outperform corresponding baseline systems.

연구 동기 및 목표

  • 제한된 훈련 데이터로 인한 엔드 투 엔드 음성 감정 인식의 과적합 문제를 해결하기 위해.
  • 다중 작업 학습을 통해 자극성, 정서적 강도, 지배성 등의 다수 감정 차원을 함께 학습함으로써 표현의 강건성을 향상시키기 위해.
  • 자기주의 주의 메커니즘을 통합하여 관련 음성 세그먼트의 중요도를 동적으로 가중함으로써 작업별 특징의 중요도를 향상시키기 위해.
  • 다중 작업 학습과 주의 메커니즘의 조합이 엔드 투 엔드 프레임워크에서 음성 감정 예측에 효과적인지 평가하기 위해.

제안 방법

  • 자극성, 정서적 강도, 지배성의 세 감정 차원에 대해 공유 인코더 레이어를 사용하여 공동 표현을 추출하는 깊은 신경망 아키텍처를 사용한다.
  • 모든 세 감정 예측 헤드의 손실 함수를 동시에 최적화하여 일반화 성능을 향상시키기 위해 다중 작업 학습을 적용한다.
  • 각 작업별 헤드 위에 주의 메커니즘을 추가하여 입력 음성 세그먼트의 시간적 부분에 대한 동적 중요도 가중치를 학습한다.
  • 손으로 만든 특징 없이 원시 음성 신호에서 엔드 투 엔드로 훈련되며, 1D-CNN과 LSTM 아키텍처를 사용하여 순차적 모델링을 수행한다.
  • 주의 가중치는 척도화된 도트곱 주의 메커니즘을 사용하여 계산되며, 네트워크가 각 감정 작업에 맞는 주목할 만한 세그먼트에 집중할 수 있도록 한다.
  • 주요 평가 지표로 UAR(Unweighted Accuracy Recall)를 사용하여 IEMOCAP 데이터셋에서 실험을 수행한다.

실험 결과

연구 질문

  • RQ1자극성, 정서적 강도, 지배성 등의 다수 감정 차원을 함께 학습함으로써 엔드 투 엔드 음성 감정 인식에서 표현의 강건성을 향상시키고 과적합을 줄일 수 있는가?
  • RQ2주의 메커니즘을 통합함으로써 모델이 작업별 주목할 만한 음성 세그먼트에 집중할 수 있게 되어 성능 향상이 이루어지는가?
  • RQ3감정 예측 작업 간 주의 가중치는 어떻게 다름가? 이는 알려진 음성 감정의 음향적 특징과 일치하는가?
  • RQ4제안된 엔드 투 엔드 다중 작업 학습 프레임워크에 주의 메커니즘을 통합한 모델이 단일 작업 엔드 투 엔드 모델과 손으로 만든 특징을 사용하는 전통적 시스템보다 성능이 뛰어나게 되는가?

주요 결과

  • 제안된 주의 메커니즘 강화 엔드 투 엔드 다중 작업 학습 시스템은 자극성 예측에서 48.5% UAR를 기록하여 기준 엔드 투 엔드 시스템(45.1% UAR)보다 유의미하게 높은 성능(유의수준 p < 0.05)을 보였다.
  • 정서적 강도 예측에서는 63.8% UAR를 달성하여 기준 엔드 투 엔드 모델(60.9% UAR)보다 유의미한 향상을 보였다.
  • 다중 작업 학습과 주의 메커니즘의 조합은 여섯 가지 평가 사례 중 다섯 곳에서 최고 성능을 기록하여 상호보완적 이점을 입증하였다.
  • 주의 가중치는 작업 간에 의미 있는 차이를 보였다: 자극성은 고세기 세그먼트에 집중하고, 정서적 강도는 저세기 부분에 집중하며, 지배성은 고에너지 영역에 집중하는 경향을 보였으며, 이는 알려진 음향적 특징과 일치하였다.
  • 성능 향상에도 불구하고, 자극성 예측에서는 손으로 만든 특징 기반 시스템에 비해 여전히 성능이 열등하여, 전통적인 특징이 단순한 자극성 패tern을 더 잘 포착할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.