Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Empathetic Chatbots in Customer Service Settings

Akshay Agarwal, Shashank Maiya|arXiv (Cornell University)|2021. 01. 05.
AI in Service Interactions참고 문헌 14인용 수 8
한 줄 요약

이 논문은 20개 브랜드의 대규모 트위터 데이터셋을 사용하여 고객 서비스에서 공감하는 대화형 챗봇의 성능을 평가하며, 정서를 인식하고 공감하는 방식으로 훈련된 모델이 비공감적인 모델보다 인간 상담사의 응답과 더 유사한 응답을 생성함을 보여준다. 주요 기여는 공감 능력과 임무 중심 기술을 융합한 모델이 고객 서비스 챗봇의 응답 자연스러움과 인간다움을 크게 향상시킨다는 경험적 검증이다.

ABSTRACT

Customer service is a setting that calls for empathy in live human agent responses. Recent advances have demonstrated how open-domain chatbots can be trained to demonstrate empathy when responding to live human utterances. We show that a blended skills chatbot model that responds to customer queries is more likely to resemble actual human agent response if it is trained to recognize emotion and exhibit appropriate empathy, than a model without such training. For our analysis, we leverage a Twitter customer service dataset containing several million customeragent dialog examples in customer service contexts from 20 well-known brands.

연구 동기 및 목표

  • 채팅 봇이 공감적인 응답을 제공할 경우 인간 상담사의 행동과 얼마나 잘 일치하는지 조사하기 위해.
  • 공감 인식과 임무 중심 응답 생성을 융합한 복합 기술 모델의 효과성을 평가하기 위해.
  • 주요 브랜드의 실제 고객 서비스 대화를 분석하여 공감이 응답 품질에 미치는 영향을 평가하기 위해.
  • 정서 인지 모델이 비공감적인 기준 모델보다 더 인간다운 응답을 생성하는지 확인하기 위해.
  • 대규모 소셜 미디어 데이터를 활용하여 개방형 고객 서비스 챗봇에서 공감의 가치에 대한 경험적 증거를 제공하기 위해.

제안 방법

  • 연구는 20개 주요 브랜드에서 온 수백만 개의 대화를 포함한 트위터 기반 고객 서비스 데이터셋을 사용한다.
  • 사용자 정서를 인식하고 적절한 공감 응답을 생성할 수 있도록 복합 기술 모델을 훈련한다.
  • 인간이 주석 처리한 정서 레이블을 활용한 지도 신호를 통해 정서 감지 및 응답 생성에 대해 미세조정한다.
  • 공감성과 자연스러움 측면에서 모델의 응답을 실제 인간 상담사의 응답과 비교하기 위해 인간 평가를 실시한다.
  • 공감 훈련이 없는 기준 모델과 공감 챗봇을 비교하여 성능 차이를 측정한다.
  • 응답 품질과 인간다움의 유의미한 차이를 평가하기 위해 통계 분석을 사용한다.

실험 결과

연구 질문

  • RQ1정서를 인식하고 공감적으로 응답하도록 훈련한 챗봇이 인간 상담사의 응답과 더 유사한 응답을 생성하는가?
  • RQ2실제 고객 서비스 대화에서 공감 챗봇의 성능은 비공감 기반 기준 모델과 비교해 어떻게 다른가?
  • RQ3정서 인지 응답이 고객 서비스 상호작용에서 느껴지는 공감성과 자연스러움을 어느 정도 향상시키는가?
  • RQ4공감 능력과 임무 중심 기술을 융합한 모델은 단순히 임무 완수에 집중한 모델보다 뛰어난 성능을 보일 수 있는가?
  • RQ5대규모 실세계 고객 서비스 데이터에서 공감은 챗봇 응답의 인간다움에 어떤 영향을 미치는가?

주요 결과

  • 공감 챗봇 모델이 비공감 기반 기준 모델보다 인간 상담사의 응답과 유의미하게 더 유사한 응답을 생성했다.
  • 정서 인식 및 공감 응답 생성을 훈련한 모델은 인간 평가에서 더 높은 공감성 평가를 받았다.
  • 복합 기술 모델은 자연스러움과 인간다움 지표에서 비공감 모델보다 뛰어난 성능을 보였다.
  • 감정적으로 민감한 상황에서 정서 인지 응답은 더 적절하고 맥락에 부합하는 것으로 평가되었다.
  • 연구 결과는 임무 중심 챗봇에 공감 능력을 통합할 경우 임무 완수 정확도를 희생시키지 않고도 응답 품질을 향상시킬 수 있음을 확인했다.
  • 결과적으로 공감 능력이 실세계 환경에서 현실적이고 효과적인 고객 서비스 챗봇을 구현하는 데 핵심적인 요소임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.