Skip to main content
QUICK REVIEW

[논문 리뷰] A System for Human-AI collaboration for Online Customer Support

Debayan Banerjee, Mathis Poser|arXiv (Cornell University)|2023. 01. 28.
AI in Service Interactions인용 수 5
한 줄 요약

이 논문은 실시간으로 인간-AI 협업을 구현하는 온라인 고객 지원 시스템을 제시한다. 여기서 AI 에이전트는 인간 에이전트의 대화를 수동으로 듣고, 에이전트에게만 보이는 관련 FAQ 제안을 제공한다. 학생들의 문의 사례를 담은 독일어 데이터셋을 대상으로 평가한 결과, 시스템은 에이전트의 작업 부담을 크게 줄였으며, FAQ 제안의 MRR가 0.5 이상을 달성하고 평균으로 상호작용당 6건의 제안을 활용하게 했으며, 효과적인 제안 없음 탐지 기능을 통해 소음을 낮게 유지했다.

ABSTRACT

AI enabled chat bots have recently been put to use to answer customer service queries, however it is a common feedback of users that bots lack a personal touch and are often unable to understand the real intent of the user's question. To this end, it is desirable to have human involvement in the customer servicing process. In this work, we present a system where a human support agent collaborates in real-time with an AI agent to satisfactorily answer customer queries. We describe the user interaction elements of the solution, along with the machine learning techniques involved in the AI agent.

연구 동기 및 목표

  • 고객 서비스 에이전트를 대체하지 않으면서도 인지적 부담과 응답 시간을 줄이는 하이브리드 인간-AI 시스템을 개발하는 것.
  • 직접 사용자 인터랙션 없이 인간-에이전트 대화를 듣고 적절한 시점에만 관련 FAQ를 제안하는 수동적 AI 에이전트를 설계하는 것.
  • 자원봉사 조직에서 학생들의 문의를 처리하는 실제 인간 에이전트의 사용성과 시스템 영향을 평가하는 것.
  • 고성능의 FAQ 제안과 제안 없음 탐지 기능을 균형 있게 조정하여 소음과 오진을 최소화하는 AI 모델을 校정하는 것.
  • 향후 온라인 학습을 위한 피드백 메커니즘을 개선하여 인간 에이전트의 수정 사항을 기반으로 시스템이 적응할 수 있도록 하는 것.

제안 방법

  • ReactJS와 Flask를 사용해 개발한 웹 기반 UI를 통해 인간 에이전트와 AI 간 실시간 상호작용이 가능하며, 채팅 인터페이스는 Rocket.Chat 기반으로 구현되었다.
  • AI 에이전트는 대화 맥락을 기반으로 FAQ를 순위 매기는 기계학습 모델을 사용하며, 상위 2개의 제안은 항상 표시되고, 나머지 4개는 '기각' 버튼을 통해 접근할 수 있다.
  • 에이전트가 상호작용를 관련 FAQ에 연결할 수 있도록 검색어를 제출할 수 있는 피드백 기능을 포함하고 있으나, 평가 기간 동안 온라인 모델 재학습에 사용되지 않았다.
  • AI 모델은 관련 FAQ 제안과 '제안 없음' 응답을 모두 예측하도록 훈련되었으며, 양 클래스에 대해 MRR@10을 사용해 성능을 평가했다.
  • 183건의 독일어 대화 데이터셋을 수집하고, FAQ ID로 주석을 추가하여 모델 훈련 및 평가의 기초 자료로 활용했다.
  • 시스템은 이중 평가 접근법을 사용한다: 자동화된 MRR 기반 모델 평가와 인터뷰 및 화면 녹화를 통한 정성적 인간 평가.

실험 결과

연구 질문

  • RQ1직접 사용자 인터랙션 없이 인간 에이전트가 실시간 고객 지원에서 AI 에이전트를 어떻게 지원받을 수 있는가?
  • RQ2FAQ 제안 정확도와 제안 없음 성능 사이의 최적의 균형은 무엇이며, 이를 통해 에이전트의 작업 부담과 소음을 최소화할 수 있는가?
  • RQ3실제 지원 상황에서 인간 에이전트는 AI 기반 FAQ 제안의 사용성과 유용성에 대해 어떻게 평가하는가?
  • RQ4시스템은 에이전트가 정확한 응답을 찾고 제공하는 데 소요되는 시간과 노력을 얼마나 줄이는가?
  • RQ5인간 에이전트의 피드백는 어떻게 효과적으로 AI 모델에 통합되어 장기적인 성능 향상에 기여할 수 있는가?

주요 결과

  • 인간 에이전트는 평균으로 상호작용당 6건의 FAQ 제안을 사용했으며, 18명의 에이전트 중 17명이 복사-채팅 버튼을 최소 3번 이상 사용하여 시스템에 대한 높은 참여도를 보였다.
  • 에이전트는 평균으로 제안된 응답을 2번 편집한 후 전송했으며, 이는 AI가 사용자 맞춤형 수정을 가능하게 하는 유용한 기초를 제공했음을 시사한다.
  • 더 많은 정보가 필요한 경우를 위해 사용된 '더 많은 정보 얻기' 버튼의 평균 사용 횟수(3.7회)는 짧은 형식의 버튼(2.6회)보다 높았으며, 이는 에이전트가 의사결정을 내리기 위해 상세한 맥락을 중요하게 여겼음을 나타낸다.
  • 에이전트는 평균으로 상호작용당 15번의 '기각' 버튼을 클릭했으며, 이는 다른 제안을 활발히 탐색하고 추천 인터페이스에 높은 참여도를 보였음을 보여준다.
  • AI 모델은 FAQ 클래스에서 MRR가 0.5 이상을 달성했으며, 이는 정확한 FAQ가 일반적으로 첫 번째 또는 두 번째 순위에 위치했음을 의미한다. 이는 검색 시간을 크게 줄였다.
  • 제안 없음 클래스의 성능은 핵심적이었으며, MRR 값이 1.0에 가까운 높은 성능이 유지를 해야 에이전트가 관련 없는 제안으로 혼란을 겪는 것을 방지할 수 있었고, 이는 침묵 탐지 기능의 중요성을 강조했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.