Skip to main content
QUICK REVIEW

[논문 리뷰] ANA at SemEval-2019 Task 3: Contextual Emotion detection in Conversations through hierarchical LSTMs and BERT

Chenyang Huang, Amine Trabelsi|arXiv (Cornell University)|2019. 03. 30.
Sentiment Analysis and Opinion Mining참고 문헌 16인용 수 5
한 줄 요약

이 논문은 대화에서의 맥락적 정서 검출을 위한 계층적 LSTM 아키텍처와 다중 헤드 자기주의를 결합한 HRLCE 모델을 제안한다. 이 모델은 SemEval-2019 Task 3 데이터셋에서 BERT를 능가하며, HRLCE와 BERT의 앙상블는 165개 팀 중 5위에 해당하는 매크로-F1 스코어 0.7709를 기록했다.

ABSTRACT

This paper describes the system submitted by ANA Team for the SemEval-2019 Task 3: EmoContext. We propose a novel Hierarchical LSTMs for Contextual Emotion Detection (HRLCE) model. It classifies the emotion of an utterance given its conversational context. The results show that, in this task, our HRCLE outperforms the most recent state-of-the-art text classification framework: BERT. We combine the results generated by BERT and HRCLE to achieve an overall score of 0.7709 which ranked 5th on the final leader board of the competition among 165 Teams.

연구 동기 및 목표

  • 대화 텍스트에서 다중 전환 대화 맥락을 효과적으로 모델링하여 맥락적 정서 검출을 향상시키기.
  • 은유어, 이모티콘, 클래스 불균형 등이 존재하는 짧고 비공식적인 소셜미디어 텍스트에서 정서 검출의 과제를 해결하기.
  • 발언과 그 대화력 기록으로부터 의미적 및 정서적 맥락을 모두 포착하는 모델을 개발하기.
  • 대화 맥락에서 정서 분류에 있어 BERT와 같은 최신 기술을 능가하는 모델을 개발하기.
  • 계층적 LSTMs와 BERT를 조합한 강력한 앙상블 시스템을 구축하여 EmoContext 과제에서 성능을 향상시키기.

제안 방법

  • 두 개의 RNN 레이어인 발언 인코더와 맥락 인코더를 사용하여, 발언 수준에서는 발언을 인코딩하고, 대화 수준에서는 맥락을 인코딩하기 위해 계층적 LSTMs(HRED)를 활용한다.
  • 맥락 수준의 은닉 상태에 다중 헤드 자기주의를 통합하여 맥락 표현을 정밀화하고 장거리 의존성을 포착한다.
  • BERT, ELMo, GloVe, DeepMoji를 포함한 사전 학습된 임베딩을 사용하여 단어 수준의 의미적 및 정서적 표현을 풍부하게 한다.
  • 맥락(u1, u2)을 첫 번째 문장으로, 대상 발언(u3)을 두 번째 문장으로 하는 입력 쌍을 사용하여 BERT를 미세조정함으로써 맥락-대상 관계를 강조한다.
  • 클래스 불균형을 완화하기 위해 경험적 레이블 분포 추정치를 기반으로 한 클래스 가중 교차 엔트로피 손실을 적용한다.
  • 9겹 교차 검증 설정에서 HRLCE와 BERT의 예측을 다수결 투표 방식으로 조합하여 모델 안정성과 앙상블 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1자기주의를 갖춘 계층적 LSTM 아키텍처가 대화 텍스트의 맥락적 정서 검출에서 BERT를 능가할 수 있는가?
  • RQ2BERT, ELMo, GloVe, DeepMoji와 같은 다수의 사전 학습된 임베딩 통합이 의미적 및 정서적 특징을 포착하는 데 얼마나 효과적인가?
  • RQ3계층적 RNN을 사용하여 대화 맥락을 모델링할 경우, 단일 시퀀스 모델 대비 정서 분류 정확도가 얼마나 향상되는가?
  • RQ4클래스 불균형과 은유어는 소셜미디어 텍스트에서 정서 검출 성능에 어떤 영향을 미치는가?
  • RQ5HRLCE와 BERT의 앙상블가 개별 모델 대비 EmoContext 벤치마크에서 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • HRLCE 모델은 개발 세트에서 가장 높은 개별 매크로-F1 스코어를 기록했으며, BERT와 간단한 LSTM 기반 모델을 모두 능가했다.
  • HRLCE와 BERT의 앙상블는 테스트 세트에서 매크로-F1 스코어 0.7709를 기록했으며, SemEval-2019 Task 3 경연에서 165개 팀 중 5위를 차지했다.
  • 모든 모델에서 정서 '슬픔'이 가장 높은 정확도로 분류되었고, '행복'이 가장 자주 잘못 분류되었으며, 특히 '기타' 카테고리로 오분류되는 경향이 있었다.
  • 오분류의 대부분은 '기타' 카테고리와 세 가지 주요 정서(행복, 분노, 슬픔) 사이에서 발생했으며, 중립적 또는 모호한 정서 표현을 구분하는 데 어려움이 있음을 시사했다.
  • 테스트 세트에서의 모델 성능이 개발 세트보다 略로 낮게 나타나, 도메인 이동 또는 과적합 경향이 있을 가능성을 시사했다.
  • 혼동 행렬은 '행복', '분노', '슬픔' 간의 교차 분류가 최소한이었음을 보여주며, '기타' 클래스와의 조합에서 주요 정서 간 강력한 구분 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.