Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring ChatGPT's Empathic Abilities

Kristina Schaaff, Caroline Reinig|arXiv (Cornell University)|2023. 08. 07.
Digital Mental Health Interventions인용 수 4
한 줄 요약

이 연구는 표준화된 심리학적 설문지를 사용하여 챗지피티의 공감 능력을 감정 이해 및 표현, 동반 감정 반응, 공감 성격의 세 가지 차원에서 평가한다. 결과적으로 챗지피티는 91.7%의 경우에서 감정을 정확히 식별하고, 상호작용의 70.7%에서 동반 감정 반응을 보이며, 아스퍼거 증후군을 가진 사람들보다는 우수하지만 건강한 인간 평균 수준에는 못 미치는 공감 지표를 보였다.

ABSTRACT

Empathy is often understood as the ability to share and understand another individual's state of mind or emotion. With the increasing use of chatbots in various domains, e.g., children seeking help with homework, individuals looking for medical advice, and people using the chatbot as a daily source of everyday companionship, the importance of empathy in human-computer interaction has become more apparent. Therefore, our study investigates the extent to which ChatGPT based on GPT-3.5 can exhibit empathetic responses and emotional expressions. We analyzed the following three aspects: (1) understanding and expressing emotions, (2) parallel emotional response, and (3) empathic personality. Thus, we not only evaluate ChatGPT on various empathy aspects and compare it with human behavior but also show a possible way to analyze the empathy of chatbots in general. Our results show, that in 91.7% of the cases, ChatGPT was able to correctly identify emotions and produces appropriate answers. In conversations, ChatGPT reacted with a parallel emotion in 70.7% of cases. The empathic capabilities of ChatGPT were evaluated using a set of five questionnaires covering different aspects of empathy. Even though the results show, that the scores of ChatGPT are still worse than the average of healthy humans, it scores better than people who have been diagnosed with Asperger syndrome / high-functioning autism.

연구 동기 및 목표

  • 챗지피티가 인간처럼 감정을 이해하고 표현할 수 있는지 조사하기 위해.
  • 감정 공감의 핵심 요소인 동반 감정 반응 능력이 챗지피티에 얼마나 구현되어 있는지 평가하기 위해.
  • 표준화된 심리학적 설문지를 사용하여 챗지피티의 공감 성격을 평가하기 위해.
  • 건강한 인간과 아스퍼거 증후군을 가진 사람들과의 비교를 통해 챗지피티의 공감 성능을 평가하기 위해.
  • 챗지피티와 같은 대규모 언어 모델의 공감 능력을 평가하기 위한 재현 가능한 프레임워크를 수립하기 위해.

제안 방법

  • 이 연구는 감정 이해 및 표현, 동반 감정 반응 분석, 공감 성격 평가의 세 단계로 구성된 방법론을 적용하였다.
  • 감정 이해 평가에서는 120개의 프롬프트를 사용하여 챗지피티가 특정 감정을 표현하도록 문장을 재구성할 수 있는지 검증하였으며, 정확도는 인간 평가자에 의한 주석을 통해 측정되었다.
  • 동반 감정 반응 평가에서는 120개의 대화를 분석하여 챗지피티가 사용자의 감정과 동일한 감정을 반영하여 응답했는지 확인하였으며, 수동 레이블링 방식을 사용하였다.
  • 공감 성격 평가는 IRI, EQ, TEQ, PES, AQ 등 다섯 가지 검증된 심리학적 설문지를 사용하여 수행되었으며, 건강한 남성과 여성의 일반 데이터와 비교하였다.
  • 모든 데이터는 에마패식다이얼로그 데이터셋에서 유래되었으며, 챗지피티가 생성한 것으로, 인간 평가자가 감정 내용을 주석 처리하여 검증하였다.
  • 챗지피티의 점수와 인간 기준 간 통계적 비교를 실시하였으며, 효과 크기와 백분율 차이를 포함하였다.
Figure 2: Accuracy of Understanding and Expressing Emotions.
Figure 2: Accuracy of Understanding and Expressing Emotions.

실험 결과

연구 질문

  • RQ1챗지피티는 사용자 입력에 대해 얼마나 정확하게 특정 감정을 식별하고 표현할 수 있는가?
  • RQ2챗지피티는 사용자의 정서 상태를 반영하는 동반 감정 반응을 얼마나 자주 보이는가?
  • RQ3챗지피티의 공감 성격 점수는 건강한 인간과 아스퍼거 증후군 환자들과 비교해 여러 공감 차원에서 어떻게 다른가?
  • RQ4표준화된 심리학적 설문지를 통해 챗지피티와 같은 대규모 언어 모델의 공감 능력을 신뢰성 있게 평가할 수 있는가?
  • RQ5부분적인 공감 능력을 지닌 챗봇을 인간-컴퓨터 상호작용에 도입할 경우의 윤리적 함의는 무엇인가?

주요 결과

  • 챗지피티는 테스트 케이스의 91.7%에서 의도된 감정을 정확히 식별하고 표현하여 강력한 감정 이해 및 표현 능력을 보였다.
  • 대화의 70.7%에서 챗지피티는 사용자와 동일한 감정 상태로 반응하여 사용자 감정을 반영하는 데 뚜렷한 능력을 보였다.
  • 챗지피티의 총공감 점수는 건강한 인간보다 유의미하게 낮았으며, 주요 공감 척도에서 효과 크기는 60%에서 77%까지 낮았다.
  • 전반적인 공감 수준이 낮음에도 불구하고, 챗지피티는 인지적 공감과 정서 조절 측면에서 아스퍼거 증후군 환자들보다 전반적으로 뛰어난 성능을 보였다.
  • 챗지피티는 기쁨을 반영하는 데 강한 경향을 보였으며, 이는 훈련 데이터의 편향이나 프롬프트-응답 패tern 때문일 수 있다.
  • 이 연구는 언어 모델의 공감 능력을 평가하기 위한 검증된 다각적 프레임워크를 제공하며, 향후 평가를 위한 템플릿을 제시한다.
Figure 4: Distribution of ChatGPT’s Emotional Responses.
Figure 4: Distribution of ChatGPT’s Emotional Responses.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.