Skip to main content
QUICK REVIEW

[논문 리뷰] Affect Recognition in Conversations Using Large Language Models

Shutong Feng, Guangzhi Sun|arXiv (Cornell University)|2023. 09. 22.
Mental Health via WritingPsychology인용 수 3
한 줄 요약

이 연구는 IEMOCAP, EmoWOZ, DAIC-WOZ 데이터셋을 사용하여 대화에서 정서 인식을 위한 대규모 언어 모델(Large Language Models, LLMs)의 성능을 평가한다. 소수의 예시를 활용한 인라인 학습(Zero-shot 및 Few-shot in-context learning)과 미세조정(fine-tuning)이 LLM 성능을 크게 향상시키며, GPT-4가 최고의 성능을 기록함을 입증한다. 다만, 우울증 탐지에서는 ASR 오류에 민감하게 반응하여 성능 저하가 발생함을 확인하였다.

ABSTRACT

Affect recognition, encompassing emotions, moods, and feelings, plays a pivotal role in human communication. In the realm of conversational artificial intelligence, the ability to discern and respond to human affective cues is a critical factor for creating engaging and empathetic interactions. This study investigates the capacity of large language models (LLMs) to recognise human affect in conversations, with a focus on both open-domain chit-chat dialogues and task-oriented dialogues. Leveraging three diverse datasets, namely IEMOCAP (Busso et al., 2008), EmoWOZ (Feng et al., 2022), and DAIC-WOZ (Gratch et al., 2014), covering a spectrum of dialogues from casual conversations to clinical interviews, we evaluate and compare LLMs' performance in affect recognition. Our investigation explores the zero-shot and few-shot capabilities of LLMs through in-context learning as well as their model capacities through task-specific fine-tuning. Additionally, this study takes into account the potential impact of automatic speech recognition errors on LLM predictions. With this work, we aim to shed light on the extent to which LLMs can replicate human-like affect recognition capabilities in conversations.

연구 동기 및 목표

  • 대화형 AI에서 정서 및 우울증 심각도 인식에 있어 LLM의 제로샷 및 소수의 예시를 활용한 Few-shot 능력을 평가하는 것.
  • 자동 음성 인식(ASR) 오류가 LLM 기반 정서 인식에 미치는 영향을 조사하는 것.
  • 다양한 대화 유형에서 정서 인식에 있어 인라인 학습(ICL)과 작업 특화 미세조정의 효과를 비교하는 것.
  • LLM이 개방형 대화 및 작업 중심 대화에서 인간과 유사한 정서 인식을 수행할 수 있는지 평가하는 것.
  • 실제 ASR 오류 조건 하에서, LLM이 말하기 기반 대화 시스템의 백엔드로 활용될 잠재력을 탐색하는 것.

제안 방법

  • IEMOCAP(정서), EmoWOZ(작업 중심 대화), DAIC-WOZ(우울증 스크리닝) 세 가지 데이터셋에서 정서 인식을 위해 LLaMA-7B, Alpaca-7B, GPT-3.5, GPT-4의 네 가지 LLM을 활용함.
  • LLM이 제로샷 및 소수의 예시를 활용한 인라인 학습(ICL) 설정에서 정확히 동작하도록 도와주기 위해 정서 정의와 맥락 기반 지침을 포함한 프롬프트 템플릿을 설계함.
  • 다양한 수의 소수의 예시(N=0에서 N=5)를 활용한 인라인 학습을 수행하여 프롬프트 엔지니어링의 성능에 미치는 영향을 평가함.
  • LLaMA-7B, Alpaca-7B, GPT-2에 대해 25%, 50%, 75%, 100%의 훈련 데이터를 사용하여 작업 특화 미세조정을 수행하여 모델의 능력과 데이터 효율성을 평가함.
  • 말하기 기반 대화 시스템에서의 안정성을 평가하기 위해 유저 발화 문장에 합성된 ASR 오류를 주입함. 특히 우울증 탐지에 대한 영향을 집중적으로 분석함.
  • 다중 클래스 정서 및 우울증 심각도 분류 작업에서 성능을 평가하기 위해 가중 F1 및 매크로 F1과 같은 표준 지표를 사용함.

실험 결과

연구 질문

  • RQ1다양한 대화 유형, 특히 대화 중심 및 작업 중심 대화에서 LLM의 제로샷 및 소수의 예시를 활용한 정서 인식 성능은 어떠한가?
  • RQ2소수의 예시를 활용한 인라인 학습이 제로샷 설정 대비 LLM의 정서 인식 성능 향상에 얼마나 기여하는가?
  • RQ3작업 특화 미세조정은 LLM의 정서 인식 능력을 얼마나 효과적으로 향상시키며, 얼마나 적은 비율의 훈련 데이터로도 근접한 최상위 성능(SOTA)을 달성할 수 있는가?
  • RQ4말하기 대화에서 정서 인식 및 우울증 탐지 시, 자동 음성 인식(ASR) 오류에 LLM은 얼마나 내성적인가?
  • RQ5레이블 의미와 클래스 불균형은 미세조정된 LLM의 정서 인식 성능에 어떤 영향을 미치는가?

주요 결과

  • GPT-4는 모든 데이터셋에서 최고의 성능을 기록하였으며, IEMOCAP(4원)에서 가중 F1 0.78, EmoWOZ에서 0.74를 기록하여 제로샷 및 소수의 예시 설정 모두에서 다른 LLM들을 압도함.
  • 소수의 예시를 활용한 인라인 학습이 성능 향상에 크게 기여하였으며, 특히 더 큰 모델에서 두드러짐: GPT-3.5와 GPT-4는 소수의 예시 수가 증가함에 따라 일관되게 성능 향상을 보였고, IEMOCAP 및 EmoWOZ의 4원 분류에서 N=1에서 최고 성능에 도달함.
  • 작업 특화 미세조정을 통해 LLaMA-7B와 Alpaca-7B는 훈련 데이터의 50%만으로도 IEMOCAP(4원)와 EmoWOZ에서 근접한 최상위 성능(SOTA)을 달성하였으며, 가중 F1 점수 0.75 이상 기록함.
  • IEMOCAP(5원)에서 전체 훈련 데이터를 사용한 미세조정조차도 지도 학습 기반 최상위 성능(SOTA)과 성능 격차가 존재함. 이는 영향력이 모호한 '기타' 클래스가 포함되어 있어 정서적 특이성이 떨어지기 때문으로 보임.
  • GPT-2는 클래스 불균형으로 인해 미세조정 후 성능 저하를 보였으며, '중립'을 과도하게 예측하여 평가 지표에서 제외됨.
  • LLM은 정서 인식에서는 ASR 오류에 대해 뛰어난 내성성을 보였지만, 우울증 탐지에서는 뚜렷한 성능 저하를 보였으며, 노이즈가 많은 입력에서 고위험 정서 콘텐츠에 민감하게 반응함을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.