Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Task Learning with Auxiliary Speaker Identification for Conversational Emotion Recognition

Jingye Li, Meishan Zhang|arXiv (Cornell University)|2020. 03. 03.
Sentiment Analysis and Opinion Mining참고 문헌 25인용 수 22
한 줄 요약

이 논문은 BERT와 계층적 Bi-GRU 네트워크를 통해 공유 표현을 활용하면서도, 화자 식별(SI)을 보조 과제로 사용하여 대화형 정서 인식(CER)을 향상시키는 다중 과제 학습 프레임워크를 제안한다. 주어진 방법은 주어진 음성 인식 성능을 향상시키기 위해 음성 인식 성능을 향상시키기 위해 공유 표현을 활용한다. EmoryNLP(+1.16% F1)와 MELD(+0.59% F1)에서 새로운 최고 성능을 달성하며, 화자 인식 가능한 문맥 표현을 향상시킨다.

ABSTRACT

Conversational emotion recognition (CER) has attracted increasing interests in the natural language processing (NLP) community. Different from the vanilla emotion recognition, effective speaker-sensitive utterance representation is one major challenge for CER. In this paper, we exploit speaker identification (SI) as an auxiliary task to enhance the utterance representation in conversations. By this method, we can learn better speaker-aware contextual representations from the additional SI corpus. Experiments on two benchmark datasets demonstrate that the proposed architecture is highly effective for CER, obtaining new state-of-the-art results on two datasets.

연구 동기 및 목표

  • 화자 민감도 있는 발화 표현을 효과적으로 모델링하여 대화형 정서 인식(CER) 성능을 향상시키는 것.
  • 화자 인식 가능한 표현을 학습하기 위해 오직 정서 레이블이 부여된 데이터에 의존하는 데서 비롯되는 한계를 해결하는 것.
  • 화자 식별 정보를 가진 대규모 비약어 대화 코퍼스를 활용하여 표현 학습을 위한 활용 가능성을 탐색하는 것.
  • 화자 식별(SI)을 보조 과제로 사용할 경우 다중 과제 학습을 통해 CER 성능 향상이 가능한지 탐구하는 것.
  • 발화 수준 및 대화 수준에서 CER와 SI 과제 간 상호 작용을 가능하게 하는 통합 학습 프레임워크를 설계하는 것.

제안 방법

  • CER와 SI를 공유 및 과제별 구성 요소를 사용하여 공동으로 학습하는 다중 과제 학습(MTL) 프레임워크를 사용한다.
  • 발화 표현을 위한 기본 문맥 인코더로 BERT를 사용하며, 이후 발화 수준 및 대화 수준에서 계층적 양방향 GRU를 적용한다.
  • 발화 수준 및 대화 수준에서 CER와 SI 간의 완전한 상호 작용을 가능하게 하기 위해 주의 메커니즘과 게이트 메커니즘을 도입한다.
  • SI의 경우 원시 대화에서 이진 분류 쌍을 구성하여 두 발화가 동일한 화자로부터 나왔는지 예측한다.
  • 화자 인식 가능한 표현을 풍부하게 하기 위해 SI 사전 학습을 위해 대규모 비약어 대화 데이터를 활용한다.
  • 공유 인코더와 과제별 헤드를 통해 두 과제를 통합하며, 특징 교환을 촉진하기 위해 상호 주의 및 게이트 메커니즘을 활용한다.

실험 결과

연구 질문

  • RQ1화자 식별(SI)을 보조 과제로 사용할 경우 대화형 정서 인식(CER) 모델의 성능 향상이 가능할까?
  • RQ2SI를 활용한 다중 과제 학습이 대화에서 화자 인식 가능한 문맥 표현을 향상시키는 데 얼마나 효과적인가?
  • RQ3주의 및 게이트 메커니즘을 통한 CER와 SI 간의 상호 작용이 더 나은 정서 인식 성능을 이끌어낼 수 있는가?
  • RQ4다양한 사전 학습된 단어 표현(GloVe, ELMo, BERT 등)을 사용할 경우 MTL의 성능 향상 정도는 어떻게 달라지는가?
  • RQ5학습된 주의 패턴이 의미 있는 화자 관련 및 맥락적으로 관련된 발화를 반영하는 정도는 어느 정도인가?

주요 결과

  • 제안된 MTL 프레임워크는 SI를 보조 과제로 사용하여 EmoryNLP 및 MELD 데이터셋 모두에서 새로운 최고 성능을 달성한다.
  • EmoryNLP에서 BERT 기반 모델은 MTL을 통해 35.92%의 F1 점수를 기록하여 기준 모델(34.76%) 대비 1.16% 향상되었다.
  • MELD에서는 MTL 강화된 BERT 모델이 61.90%의 F1 점수를 기록하여 기준 모델(61.31%) 대비 0.59% 향상되었다.
  • GloVe, ELMo, BERT를 포함한 모든 설정에서 MTL의 성능 향상은 통계적으로 유의미하다(p < 0.0001).
  • 모델은 화자 관련 단어(예: 'Phoebe', 'Rachel')에 주의를 기울이며, 동일한 화자 또는 목표 화자로부터 온 발화를 연결하는 경향을 보이며, 효과적인 화자 인식 가능한 표현 학습이 이루어졌음을 시사한다.
  • 기준 모델이 강력할수록(MTL의 효과가 더 크다) 성능 향상 폭이 감소함을 확인하여, MTL이 기초 모델이 이미 강력할 경우에 가장 유익함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.