Skip to main content
QUICK REVIEW

[논문 리뷰] SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents

Shuzheng Si, Wentao Ma|arXiv (Cornell University)|2023. 05. 22.
Topic Modeling인용 수 4
한 줄 요약

SpokenWOZ는 203만 건의 대화 턴, 5.7천 개의 대화, 8개 도메인에서 총 249시간의 음성 자료를 포함한 대규모 인간 간 음성-텍스트 데이터셋을 제공하며, written-text TOD 벤치마크와 실제 음성 대화 시스템 간 격차를 메우기 위해 설계되었습니다. 이 데이터셋은 교차 턴 슬롯 검출 및 추론 슬롯 검출과 같은 새로운 과제를 규명하였고, 현재 모델들이 여전히 성능이 열악함을 보여주며, 최고의 대화 상태 추적기의 경우 연합 목표 정확도가 단 25.65%에 그치며, 엔드 투 엔드 모델은 요청의 52.1%에서만 성공함을 보였습니다.

ABSTRACT

Task-oriented dialogue (TOD) models have made significant progress in recent years. However, previous studies primarily focus on datasets written by annotators, which has resulted in a gap between academic research and real-world spoken conversation scenarios. While several small-scale spoken TOD datasets are proposed to address robustness issues such as ASR errors, they ignore the unique challenges in spoken conversation. To tackle the limitations, we introduce SpokenWOZ, a large-scale speech-text dataset for spoken TOD, containing 8 domains, 203k turns, 5.7k dialogues and 249 hours of audios from human-to-human spoken conversations. SpokenWOZ further incorporates common spoken characteristics such as word-by-word processing and reasoning in spoken language. Based on these characteristics, we present cross-turn slot and reasoning slot detection as new challenges. We conduct experiments on various baselines, including text-modal models, newly proposed dual-modal models, and LLMs, e.g., ChatGPT. The results show that the current models still have substantial room for improvement in spoken conversation, where the most advanced dialogue state tracker only achieves 25.65% in joint goal accuracy and the SOTA end-to-end model only correctly completes the user request in 52.1% of dialogues. The dataset, code, and leaderboard are available: https://spokenwoz.github.io/.

연구 동기 및 목표

  • 학술 연구에서의 written-text TOD 데이터셋과 실제 음성 대화 시스템 간 격차를 해소하기 위해.
  • 기존 음성 TOD 데이터셋의 한계, 즉 규모가 작고, 진정성 있는 인간 간 음성 자료가 부족하며, 음성 전용 과제가 결여되어 있다는 점을 해결하기 위해.
  • 실제 음성 대화의 특성인 불완전한 발화 및 간접적 추론을 반영한 새로운 평가 과제인 교차 턴 슬롯 검출 및 추론 슬롯 검출을 도입하기 위해.
  • 대화 상태 및 대화 액션에 대한 세밀한 주석을 포함한 대규모, 고품질의 음성-텍스트 데이터셋을 제공하여 강력한 모델 훈련 및 평가를 지원하기 위해.

제안 방법

  • 실시간 음성 대화를 수집하기 위해 Wizard-of-Oz 데이터 수집 파이프라인을 확장하여 인간 에이전트와 사용자 간의 대화를 기록함.
  • 8개 도메인에서 총 5,700건의 인간 간 대화에서 249시간의 음성 자료를 확보하여 자연스러운 음성 언어 패턴을 확보함.
  • 각 발화에 대해 대화 상태 및 대화 액션 주석을 부여하여 턴 단위 주석 정확도가 97% 이상을 기록함.
  • 두 가지 새로운 과제를 도입: 불완전하거나 분할된 발화에서 상태 추적을 모델링하기 위한 교차 턴 슬롯 검출, 간접적 또는 암시적인 사용자 의도를 포착하기 위한 추론 슬롯 검출.
  • 텍스트 전용, 이중 모odal(음성+텍스트), LLM 기반 모델을 대상으로 평가 프로토콜을 포함한 종합적인 벤치마크를 구축함.
  • CC BY-NC 4.0 라이선스 하에 공개된 GitHub 리포지터리에서 데이터셋, 코드, 랭킹을 공개함.

실험 결과

연구 질문

  • RQ1대규모이고 진정성 있는 인간 간 음성-텍스트 데이터셋에서 평가할 경우, 기존의 written-text 벤치마크 대비 음성 대화 지능형 대화 시스템의 모델 성능은 어떻게 변화하는가?
  • RQ2사용자 요청 정보가 여러 발화에 걸쳐 분산되어 있는 음성 대화에서, 현재 최고의 모델들이 교차 턴 슬롯 검출 과제를 얼마나 잘 처리하는가?
  • RQ3직접적인 슬롯 추출이 아닌 간접적 추론이 필요한 경우, 모델들이 추론 슬롯을 효과적으로 탐지할 수 있는가?
  • RQ4자연스러운 음성 아티팩트와 불완전한 발화를 포함한 현실적인 음성 대화 벤치마크에서 현재의 대화 상태 추적기 및 엔드 투 엔드 모델의 성능 한계는 무엇인가?
  • RQ5이중 모달 모델(음성 + 텍스트)이 음성의 특징을 효과적으로 포착하고 현실 세계 시나리오에서 더 높은 내구성을 확보하는 데 있어 텍스트 전용 모델보다 어떻게 다를까?

주요 결과

  • 최고의 대화 상태 추적기라도 SpokenWOZ 벤치마크에서 연합 목표 정확도가 단 25.65%에 그쳐, 음성 대화에서의 상태 추적 향상 여지가 크다는 점을 시사함.
  • 최고의 엔드 투 엔드 모델이라도 사용자 요청을 올바르게 완료한 경우가 전체 대화의 52.1%에 불과하여, 현재 모델들이 인간 수준의 성능과의 격차를 여전히 좁히지 못하고 있음을 보여줌.
  • 음성과 텍스트 양방향 모달을 모두 활용함에도 불구하고, 기존의 이중 모달 모델들은 음성 대화에서 흔한 불완전하거나 분할된 발화를 처리하는 데 여전히 어려움을 겪음.
  • 교차 턴 슬롯 검출을 새로운 과제로 도입함으로써, 현재 모델들이 여러 턴에 걸쳐 분산된 슬롯을 효과적으로 추적하지 못함을 확인하였으며, 특히 발화가 끊기거나 부분적으로 말해질 경우 더욱 심각한 문제 발생.
  • 추론 슬롯 검출은 특히 도전적인 과제로 드러났으며, 모델들이 간접적 또는 암시적인 사용자 요청을 잘못 해석하는 경우가 많아, 음성 대화 시스템에서 더 나은 추론 능력과 맥락 이해 능력이 필요함을 시사함.
  • 고품질의 주석과 현실적인 음성 패턴을 갖춘 이 데이터셋은 향후 연구에 강력한 기반을 제공할 수 있으며, 내구성 있고 인간처럼 자연스러운 음성 대화 에이전트 개발을 이끄는 데 기여할 잠재력을 지님.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.