Skip to main content
QUICK REVIEW

[논문 리뷰] EmoInHindi: A Multi-label Emotion and Intensity Annotated Dataset in Hindi for Emotion Recognition in Dialogues

Gopendra Vikram Singh, Priyanshu Priya|arXiv (Cornell University)|2022. 05. 27.
Sentiment Analysis and Opinion Mining인용 수 6
한 줄 요약

이 논문은 정신 건강 및 법률 상담을 위한 워즈더오즈 설정을 통해 수집된 1,814개의 히ند리 대화(44,247개 발화)로 구성된 대규모 다중 레이블 감정 및 강도 주석이 부여된 데이터셋인 EmoInHindi를 소개한다. C-Fourier-Transformer 및 C-Attention-Transformer 모델을 활용한 강력한 컨텍스트 기반 베이스라인을 제안하여 단일 레이블 감정 및 강도 인식에서 최신 기술 수준(F1 점수 66.24%)을 달성하였으며, 저자원 언어에서의 대화 감정 인식 분야에 상당한 진전을 이룩하였다.

ABSTRACT

The long-standing goal of Artificial Intelligence (AI) has been to create human-like conversational systems. Such systems should have the ability to develop an emotional connection with the users, hence emotion recognition in dialogues is an important task. Emotion detection in dialogues is a challenging task because humans usually convey multiple emotions with varying degrees of intensities in a single utterance. Moreover, emotion in an utterance of a dialogue may be dependent on previous utterances making the task more complex. Emotion recognition has always been in great demand. However, most of the existing datasets for multi-label emotion and intensity detection in conversations are in English. To this end, we create a large conversational dataset in Hindi named EmoInHindi for multi-label emotion and intensity recognition in conversations containing 1,814 dialogues with a total of 44,247 utterances. We prepare our dataset in a Wizard-of-Oz manner for mental health and legal counselling of crime victims. Each utterance of the dialogue is annotated with one or more emotion categories from the 16 emotion classes including neutral, and their corresponding intensity values. We further propose strong contextual baselines that can detect emotion(s) and the corresponding intensity of an utterance given the conversational context.

연구 동기 및 목표

  • 히ند리와 같은 저자원 인도어에서 대규모, 다중 레이블, 강도 주석이 부여된 대화 데이터셋의 부족을 보완하기 위함.
  • 이전 발화에 의존하는 감정 상태에 따라 감정 인식이 이루어지는 컨텍스트 인식 기반 감정 인식을 가능하게 하기 위함.
  • 히нд리 발화에서 다중 감정과 그 강도(0–3)를 탐지하기 위한 강력한 신경 기반 베이스라인 개발.
  • 정신 건강 및 법률 상담과 같은 민감한 분야에서 정서적으로 지능적인 대화형 에이전트 개발을 지원하기 위함.
  • 저자원 언어 환경에서의 다중 레이블 감정 및 강도 인식에 대한 벤치마크 설정.

제안 방법

  • 데이터셋은 정신 건강 및 법률 지원 상황에서 사용자와 상담사 간의 실제 대화를 시뮬레이션하는 워즈더오즈 프레임워크를 사용하여 수집되었다.
  • 각 발화는 16개 감정 클래스(예: 기쁨, 슬픔, 분노 등) 중 하나 이상과 0–3 스케일의 강도 값으로 주석이 부여되었다.
  • 제안된 모델은 두 층의 트랜스포머 인코더, 300차원 임bedding, 초기 학습률 0.003로 설정된 Adam 최적화를 사용한다.
  • 두 주요 모델(C-Attention-Transformer 및 C-Fourier-Transformer)을 평가하였으며, 모두 음수 로그우도 손실과 30개 에포크 후 조기 정지 전략을 적용하였다.
  • 모델들은 현재 발화와 그 이전 대화 기록(최대 t−1까지)을 함께 처리하여 다중 레이블 감정 및 강도 예측을 수행한다.
  • 하이퍼파라미터는 그리드 서치를 통해 튜닝하였으며, 훈련 시 배치 크기는 32로 설정하였다.

실험 결과

연구 질문

  • RQ1워즈더오즈 방법론을 사용하여 히нд리 대화에 대해 대규모, 다중 레이블, 강도 주석이 부여된 데이터셋을 효과적으로 구축할 수 있는가?
  • RQ2컨텍스트 기반 모델은 히нд리 대화 텍스트에서 다중 감정과 그 강도를 인식하는 데 얼마나 효과적인가?
  • RQ3강력한 신경 기반 베이스라인과 기존 방법 간의 성능 격차는 저자원 언어 감정 인식에서 어떻게 나타나는가?
  • RQ4대화 기록을 통합함으로써 히нд리 대화에서 감정 및 강도 예측 성능가 향상되는가?
  • RQ5특히 어휘적 모호성 또는 감정적 맥락 전환으로 인한 감정 인식의 주요 실패 원인은 무엇인가?

주요 결과

  • C-Fourier-Transformer 모델은 단일 레이블 감정 및 강도 인식에서 최고의 F1 점수 66.24%를 기록하여 모든 베이스라인을 압도하였다.
  • C-Fourier-Transformer 모델은 정밀도 65.98%, 재현율 66.52%, F1 점수 66.24%를 기록하였으며, bc-LSTM 베이스라인 대비 6.82포인트 향상된 성능을 보였다.
  • C-Fourier-Transformer 모델은 다중 레이블 감정 예측에서 히트 링 손실(Hamming Loss) 0.055%와 재작도 지수(Jaccard Index) 0.055%를 기록하여 다른 모델 대비 두 지표에서 모두 뛰어난 성능을 보였다.
  • 기존 방법 대비 뚜렷한 향상이 있었으며, 정확도 +6.19포인트, F1 점수 +6.82포인트, 재현율 +6.8포인트 향상되었다.
  • 오류 분석 결과, 모델이 맥락이 다를 경우에도 감정적으로 강한 단어(예: '사랑스러운'은 기쁨과 연관되지만 맥락상 다른 감정일 수 있음)로 인해 감정을 잘못 분류하는 경우가 일부 발견되었다.
  • EmoInHindi 데이터셋은 다중 레이블 감정 및 강도 주석이 부여된 가장 큰 공개 가능한 히нд리 대화 데이터셋으로, 1,814개의 대화와 44,247개의 발화를 포함하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.