Skip to main content
QUICK REVIEW

[논문 리뷰] RiSAWOZ: A Large-Scale Multi-Domain Wizard-of-Oz Dataset with Rich Semantic Annotations for Task-Oriented Dialogue Modeling

Jun Quan, Shian Zhang|arXiv (Cornell University)|2020. 10. 17.
Topic Modeling참고 문헌 26인용 수 5
한 줄 요약

RiSAWOZ는 12개의 도메인을 아우르는 11,200개의 인간 간 대화를 포함한 대규모 다중 도메인 중국어 Wizard-of-Oz 데이터셋으로, 대화 상태, 대화 행위, 생략, 공호성 등 풍부한 의미적 및 언어학적 주석을 제공한다. 이는 임무 지향 대화 시스템의 벤치마크를 가능하게 하며, 종단 간 모델을 사용하여 공호성 해소에서 평균 F1이 84.49%이고, 통합된 생략 및 공호성 해소에서 Resolution_F1가 78.14%에 도달한다.

ABSTRACT

In order to alleviate the shortage of multi-domain data and to capture discourse phenomena for task-oriented dialogue modeling, we propose RiSAWOZ, a large-scale multi-domain Chinese Wizard-of-Oz dataset with Rich Semantic Annotations. RiSAWOZ contains 11.2K human-to-human (H2H) multi-turn semantically annotated dialogues, with more than 150K utterances spanning over 12 domains, which is larger than all previous annotated H2H conversational datasets. Both single- and multi-domain dialogues are constructed, accounting for 65% and 35%, respectively. Each dialogue is labeled with comprehensive dialogue annotations, including dialogue goal in the form of natural language description, domain, dialogue states and acts at both the user and system side. In addition to traditional dialogue annotations, we especially provide linguistic annotations on discourse phenomena, e.g., ellipsis and coreference, in dialogues, which are useful for dialogue coreference and ellipsis resolution tasks. Apart from the fully annotated dataset, we also present a detailed description of the data collection procedure, statistics and analysis of the dataset. A series of benchmark models and results are reported, including natural language understanding (intent detection & slot filling), dialogue state tracking and dialogue context-to-text generation, as well as coreference and ellipsis resolution, which facilitate the baseline comparison for future research on this corpus.

연구 동기 및 목표

  • 중국어에서 대규모 다중 도메인 인간 주석이 부여된 임무 지향 대화 데이터셋의 부족을 해결하기 위해.
  • 세부 언어학적 주석을 통해 생략 및 공호성과 같은 논의 현상들을 포착하여 대화 모델링을 향상시키기 위해.
  • NLU, DST, 응답 생성, 공호성 해소와 같은 여러 대화 하위 작업을 위한 종합적인 벤치마크를 제공하기 위해.
  • 넓은 도메인 커버리지와 풍부한 주석을 통해 도메인 적응, 제로샷 학습, 대화 요약 연구를 지원하기 위해.

제안 방법

  • 실제 인간 사용자와 인간 운영자가 시스템을 시뮬레이션하는 Wizard-of-Oz 설정을 통해 데이터셋을 수집하였다.
  • 각 대화는 자연어로 작성된 대화 목표, 도메인, 사용자 및 시스템 측의 대화 상태와 행위를 수동으로 주석 처리하였다.
  • 생략 및 공호성 현상을 식별하기 위해 언어학적 주석을 적용하여 논의 수준의 분석을 가능하게 하였다.
  • 5개의 핵심 작업(의도 탐지, 슬롯 채우기, 대화 상태 추적, 응답 생성, 공호성/생략 해소)에 대해 벤치마크 모델을 훈련하고 평가하였다.
  • e2e-coref 및 GECOR와 같은 종단 간 모델을 사용하여 공호성 및 통합된 생략/공호성 해소를 수행하였으며, fastText 임베딩과 주목력 메커니즘을 활용하였다.
  • 평가에는 MUC, B3, CEAF φ4 F1, BLEU, 공식 CoNLL-2012 스크립트 기반 정확도 매칭(EM)과 같은 표준 지표를 사용하였다.

실험 결과

연구 질문

  • RQ1대규모 다중 도메인 인간 주석이 부여된 대화 데이터셋은 임무 지향 대화 시스템의 강건성과 일반화 능력을 어떻게 향상시킬 수 있는가?
  • RQ2생략 및 공호성과 같은 언어학적 주석은 대화 이해 및 생성 모델의 성능을 어느 정도 향상시키는가?
  • RQ3외부 문법 분석기 없이 종단 간 모델이 다중 도메인 다중 턴 대화에서 공호성과 생략을 효과적으로 해소할 수 있는가?
  • RQ4도메인 불균형과 교차 도메인 공호성은 대화 공호성 해소 모델의 성능에 어떤 영향을 미치는가?

주요 결과

  • RiSAWOZ는 12개 도메인을 아우르는 11,200개의 대화와 150,000개 이상의 발화를 포함하여, 지금까지 가장 큰 완전 주석이 부여된 H2H 임무 지향 대화 데이터셋이다.
  • e2e-coref 모델은 전체 데이터에서 평균 F1이 84.49%를 기록했으며, 다중 도메인 대화에서는 80.60%를 기록하여 교차 도메인 복잡성에도 불구하고 뛰어난 성능을 보였다.
  • GECOR 모델은 통합된 생략 및 공호성 해소에서 정확도 매칭이 58.26%, BLEU 점수는 87.50%, Resolution_F1는 78.14%를 기록하여 실제 의미적으로 완전한 발화 생성에 효과적임을 입증하였다.
  • 이 데이터셋은 넓은 도메인 커버리지와 풍부한 주석 덕분에 대화 정책 학습, 자연어 생성, 사용자 시뮬레이션, 도메인 적응 등 다양한 연구 작업을 지원한다.
  • 언어학적 주석은 다중 터닝 대화에서 생략 및 공호성과 같은 논의 현상이 흔히 발생함을 드러내며, 이들이 대화 모델링에서 중요한 역할을 한다는 점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.