Skip to main content
QUICK REVIEW

[논문 리뷰] UniDS: A Unified Dialogue System for Chit-Chat and Task-oriented Dialogues

Xinyan Zhao, Bin He|arXiv (Cornell University)|2021. 10. 15.
Topic Modeling인용 수 5
한 줄 요약

UniDS는 사전에 훈련된 채팅 모델(DialoGPT)을 사용하여 공유 데이터 스키마와 혼합 대화 데이터에 대한 미세조정을 통해 채팅 대화와 임무 중심 대화를 동시에 처리하는 엔드 투 엔드 통합 대화 시스템을 제안한다. 이는 최신 채팅 시스템 수준의 성능을 달성하며, 최신 임무 중심 시스템을 능가하고, 추가 파rameter 없이도 대화 유형 간의 우아한 전환과 뛰어난 내성성을 보여준다.

ABSTRACT

With the advances in deep learning, tremendous progress has been made with chit-chat dialogue systems and task-oriented dialogue systems. However, these two systems are often tackled separately in current methods. To achieve more natural interaction with humans, a dialogue agent needs to be capable of both chatting and accomplishing tasks. To this end, we propose a unified dialogue system (UniDS) with the two aforementioned skills. In particular, we design a unified dialogue data schema, compatible for both chit-chat and task-oriented dialogues, and we train UniDS with mixed dialogue data from a pretrained chit-chat dialogue model. Without adding extra parameters to SOTA baselines, UniDS can alternatively handle chit-chat and task-oriented dialogues in a unified framework. Experimental results demonstrate that the proposed UniDS works comparably well as the pure chit-chat system, and it outperforms state-of-the-art task-oriented dialogue systems. More importantly, UniDS achieves better robustness as it is able to smoothly switch between two types of dialogues. These results demonstrate the feasibility and potential of building an one-for-all dialogue system.

연구 동기 및 목표

  • 사용자가 한 번의 대화에서 둘 다 필요로 하는 바를 고려할 때, 기존 대화 시스템이 채팅 대화와 임무 중심 대화를 별개의 문제로 다루는 데서 발생하는 격차를 해소하기 위해.
  • 채팅 대화와 임무 중심 대화의 구성 요소(믿음 상태, 데이터베이스 결과, 시스템 액션)를 하나의 프레임워크 안에서 지원할 수 있는 통합된 데이터 스키마를 설계하기 위해.
  • 추가 파rameter 없이 혼합된 대화 데이터에 대해 훈련하여 양 대화 유형의 엔드 투 엔드 공동 학습을 가능하게 하는 통합 모델을 훈련하기 위해.
  • 특히 ASR 간섭이 발생하는 실제 환경에서 노이즈와 임무와 관련 없는 발언에 대한 강건성을 향상시키기 위해.
  • 대화 중에 채팅 대화와 임무 중심 대화 모드 사이를 원활하게 전환할 수 있는 능력을 평가하기 위해.

제안 방법

  • 채팅 대화에 구조적 구성 요소(믿음 상태, 데이터베이스 결과, 시스템 액션)를 포함시켜 임무 중심 대화에서 일반적으로 사용되는 것과 유사한 통합된 대화 데이터 스키마를 설계한다.
  • 통합 스키마를 사용하여 채팅 대화와 임무 중심 대화 데이터의 혼합 데이터셋에 대해 사전에 훈련된 채팅 모델(DialoGPT)을 미세조정한다.
  • 임무 완료에 핵심적인 역할을 하지만 혼합 훈련에서 부족하게 강조되는 '엔티티 추천' 시스템 액션을 우선시하기 위해 가중치가 부여된 교차 엔트로피 손실을 도입한다.
  • 두 대화 유형에 동일한 모델 아키텍처를 사용하여 아키텍처 변경 없이도 채팅 대화와 임무 중심 대화 모드 간의 제로샷 전환을 가능하게 한다.
  • 자동 평가 지표(예: 통합 점수)와 MultiWOZ(TOD) 및 Reddit 기반 채팅 데이터셋에서의 인간 평가를 통해 성능을 평가한다.
  • ASR 노이즈를 시뮬레이션하기 위해 임무 중심 대화에 임무와 관련 없는(채팅용) 발언을 삽입하여 모델의 내성성과 저항력을 평가하기 위한 강건성 테스트를 실시한다.

실험 결과

연구 질문

  • RQ1통합된 데이터 스키마를 사용하여 하나의 대화 모델이 채팅 대화와 임무 중심 대화를 효과적으로 동시에 처리할 수 있는가?
  • RQ2혼합된 대화 데이터에 대한 공동 훈련이 채팅 또는 임무 중심 대화 벤치마크 성능을 떨어뜨리는가?
  • RQ3예를 들어 ASR 출력의 배경 노이즈와 같은 임무와 관련 없는 발언이 존재할 경우, 통합 모델이 강건성을 유지할 수 있는가?
  • RQ4대화 중에 채팅 대화와 임무 중심 대화 모드 사이를 얼마나 잘 전환할 수 있는가?
  • RQ5엔티티 추천을 위한 가중치가 부여된 손실이 통합 환경에서 임무 완수 능력을 향상시키는가?

주요 결과

  • 24층의 DialoGPT를 사용하여 MultiWOZ 데이터셋에서 UniDS는 통합 점수 104.12를 기록했으며, 최신 기술 수준의 임무 중심 모델인 UBAR(99.31)를 능가하고 순수 채팅 모델 수준의 성능을 달성했다.
  • 임의의 한 턴의 임무와 관련 없는 채팅 발언을 삽입했을 때 UniDS는 통합 점수에서 3.41점 하락하는 데 그쳤고, UBAR-DialoGPT는 6.23점 하락하여 훨씬 뛰어난 내성성을 보였다.
  • 두 턴의 관련 없는 발언을 삽입했을 경우 UniDS는 8.44점 하락했고, UBAR-DialoGPT는 10.64점 하락하여 노이즈에 대한 저항성에서 더욱 명확한 우월성을 입증했다.
  • 전환 사례의 98%에서 UniDS는 첫 두 턴 내에 채팅 대화와 임무 중심 대화 모드 사이를 성공적으로 전환했으며, 이는 강력한 전환 능력을 보여준다.
  • 사례 연구에서 UBAR-DialoGPT는 갑작스러운 간섭 시 믿음 상태를 유지하지 못하고 무작위 예약을 생성하는 등 실패한 반면, UniDS는 간섭 중에도 믿음 상태를 유지하고 임무 실행을 정확히 재개했다.
  • 가중치가 부여된 교차 엔트로피 손실은 모델이 엔티티 추천을 내보내는 능력을 크게 향상시켜 통합 환경에서 임무 성공에 핵심적인 역할을 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.