Skip to main content
QUICK REVIEW

[논문 리뷰] Are Current Task-oriented Dialogue Systems Able to Satisfy Impolite Users?

Zhiqiang Hu, Roy Kaa-Wei Lee|arXiv (Cornell University)|2022. 10. 24.
AI in Service Interactions인용 수 4
한 줄 요약

이 논문은 임의의 사용자와의 상호작용에서 임의의 사용자에 대한 임의의 대화 시스템의 내구성에 대해 조사하며, MultiWOZ 2.2의 10,000개의 발화를 재작성하여 대규모의 불예의스러운 대화 코퍼스를 구축한다. 실험 결과 기존의 TOD 시스템은 불예의스러운 사용자에 대해 효과적으로 대응하지 못하지만, 텍스트 스타일 전이 기반의 데이터 증강 방법이 성능을 향상시켜, 더 내구성 있고 불예의스러운 사용자에 민감한 대화 시스템이 필요하다는 점을 시사한다.

ABSTRACT

Task-oriented dialogue (TOD) systems have assisted users on many tasks, including ticket booking and service inquiries. While existing TOD systems have shown promising performance in serving customer needs, these systems mostly assume that users would interact with the dialogue agent politely. This assumption is unrealistic as impatient or frustrated customers may also interact with TOD systems impolitely. This paper aims to address this research gap by investigating impolite users' effects on TOD systems. Specifically, we constructed an impolite dialogue corpus and conducted extensive experiments to evaluate the state-of-the-art TOD systems on our impolite dialogue corpus. Our experimental results show that existing TOD systems are unable to handle impolite user utterances. We also present a data augmentation method to improve TOD performance in impolite dialogues. Nevertheless, handling impolite dialogues remains a very challenging research task. We hope by releasing the impolite dialogue corpus and establishing the benchmark evaluations, more researchers are encouraged to investigate this new challenging research task.

연구 동기 및 목표

  • 임의의 사용자, 특히 스트레스가 많거나 좌절한 상황에서 임의의 대화 시스템이 어떻게 대응하는지 연구한 바가 부족한 문제를 해결하기 위해.
  • 최신의 TOD 시스템이 불예의스러운 사용자 발화를 마주했을 때 성능 저하가 발생하는지 조사하기 위해.
  • 실제 상황을 반영하고 다양하며 대규모의 불예의스러운 대화 코퍼스를 구축하여, 불예의스러운 조건 하에서의 TOD 시스템 평가 기준을 마련하기 위해.
  • 임의의 사용자 입력을 처리할 때의 내구성을 향상시키기 위한 데이터 증강 기법을 탐색하기 위해.
  • 불예의스러운 사용자에 대한 저항력이 높은 TOD 시스템을 구축함으로써 향후 연구를 장려하기 위해.

제안 방법

  • 역할극 시나리오를 사용하여 MultiWOZ 2.2 데이터셋의 10,000개의 사용자 발화를 수동으로 재작성하여 불예의스러운 대화 코퍼스를 구축하였다.
  • 인간 평가자들이 특정 정서 상태(예: 좌절, 급박함)에서 발화를 재작성하여 다양하고 자연스러운 불예의스러운 표현을 생성하였다.
  • 문장 임bedding를 사용한 정서적 유사도 계산 및 예의 표현 수준 평가를 포함한 통계적 및 언어학적 분석을 코퍼스에 수행하였다.
  • 표준 자동 평가 지표(예: 공동 목표 정확도, 슬롯 F1)를 사용하여 여섯 가지 최신의 TOD 시스템(예: PPTOD)을 불예의스러운 코퍼스에서 평가하였다.
  • 예의 표현된 학습 데이터에서 합성된 불예의스러운 발화를 생성하기 위해 텍스트 스타일 전이를 활용한 데이터 증강 방법을 제안하였다.
  • 증강된 데이터로 TOD 모델을 미세조정하여 불예의스러운 사용자 입력을 처리할 때의 성능 향상을 평가하였다.

실험 결과

연구 질문

  • RQ1기존의 최신 기술을 적용한 임의의 대화 시스템은 불예의스러운 사용자와 상호작용했을 때 어떻게 성능을 보이는가?
  • RQ2현재의 TOD 시스템을 어렵게 만드는 불예의스러운 사용자 발화의 언어학적 및 의미적 특성은 무엇인가?
  • RQ3사용자 발화의 예의 표현 수준이 TOD 시스템의 성능 저하와 관련이 있는가?
  • RQ4텍스트 스타일 전이를 통한 데이터 증강이 불예의스러운 사용자 입력에 대한 TOD 시스템의 내구성을 향상시킬 수 있는가?
  • RQ5원본과 재작성된 발화 간의 의미 유사도가 불예의스러운 대화 상황에서의 시스템 성능에 어떤 영향을 미치는가?

주요 결과

  • PPTOD를 포함한 최신의 TOD 시스템은 불예의스러운 사용자 발화를 처리할 때 심각한 성능 저하를 보이며, 공동 목표 정확도가 크게 떨어진다.
  • 성능 저하가 가장 심각한 것은 가장 폭력적인 발화가 아니라, 중간 정도로 불예의스럽고 날카로운 표현으로, 명백하게 모욕적이지는 않지만 언어적으로 더 복잡한 경우이다.
  • 원본과 의미적으로 유사도가 낮은 불예의스러운 대화에서 시스템의 성능 저하가 심각한데, 이는 파라프레이즈나 재구성된 발화를 초월해 일반화하는 데 어려움을 겪고 있음을 시사한다.
  • 제안된 텍스트 스타일 전이 기반의 데이터 증강 방법은 불예의스러운 대화에서의 TOD 시스템 성능을 향상시켜, 내구성 향상 잠재력을 입증한다.
  • 구축된 불예의스러운 대화 코퍼스는 풍자, 급박함, 정서적 폭발 등을 포함한 다양한 불예의스러운 표현 패턴을 드러내며, 현재의 시스템은 이를 정확히 해석하지 못한다.
  • 사용자가 매우 불예의스럽더라도(예: 모욕어 사용), 일부 시스템은 여전히 부분적으로 정확한 응답을 제공한다. 이는 극도로 무례한 발언보다는 섬세하고 날카로운 불예의스러움이 더 큰 영향을 미친다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.