Skip to main content
QUICK REVIEW

[论文解读] SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents

Shuzheng Si, Wentao Ma|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用 4
一句话总结

SpokenWOZ 引入了一个大规模的人与人之间的语音-文本数据集,包含 203K 次对话轮次、5.7K 场对话和 249 小时的音频,覆盖 8 个领域,旨在弥合书面文本任务导向对话(TOD)基准与真实语音对话之间的差距。该数据集揭示了新型挑战,如跨轮次槽位检测和推理槽位检测,且表明当前模型仍表现欠佳,最佳对话状态追踪器的联合目标准确率仅为 25.65%,端到端模型仅在 52.1% 的请求中成功完成任务。

ABSTRACT

Task-oriented dialogue (TOD) models have made significant progress in recent years. However, previous studies primarily focus on datasets written by annotators, which has resulted in a gap between academic research and real-world spoken conversation scenarios. While several small-scale spoken TOD datasets are proposed to address robustness issues such as ASR errors, they ignore the unique challenges in spoken conversation. To tackle the limitations, we introduce SpokenWOZ, a large-scale speech-text dataset for spoken TOD, containing 8 domains, 203k turns, 5.7k dialogues and 249 hours of audios from human-to-human spoken conversations. SpokenWOZ further incorporates common spoken characteristics such as word-by-word processing and reasoning in spoken language. Based on these characteristics, we present cross-turn slot and reasoning slot detection as new challenges. We conduct experiments on various baselines, including text-modal models, newly proposed dual-modal models, and LLMs, e.g., ChatGPT. The results show that the current models still have substantial room for improvement in spoken conversation, where the most advanced dialogue state tracker only achieves 25.65% in joint goal accuracy and the SOTA end-to-end model only correctly completes the user request in 52.1% of dialogues. The dataset, code, and leaderboard are available: https://spokenwoz.github.io/.

研究动机与目标

  • 弥合学术界在书面文本 TOD 数据集上的研究与真实世界语音对话系统之间的差距。
  • 解决现有语音 TOD 数据集的局限性,包括规模小、缺乏真实的人与人之间的语音数据,以及缺少语音特有的挑战。
  • 引入新的评估挑战——跨轮次槽位检测和推理槽位检测,以反映真实语音对话中的动态特征,如不完整语句和间接推理。
  • 提供一个大规模、高质量的语音-文本数据集,附带详细的对话状态和对话行为标注,以支持稳健的模型训练与评估。

提出的方法

  • 扩展了 Wizard-of-Oz 数据收集流程,以收集人类代理与用户之间的实时语音对话。
  • 在 8 个领域中收集了 5,700 场人与人之间的对话,总计 249 小时音频,确保自然的口语语言模式。
  • 对每个语句进行对话状态和对话行为标注,实现超过 97% 的轮次级标注准确率。
  • 引入两项新任务:跨轮次槽位检测,用于建模在不完整或碎片化语句中的状态追踪;推理槽位检测,用于捕捉间接或隐含的用户意图。
  • 构建了一个全面的基准,包含针对纯文本、双模态(语音+文本)以及基于大语言模型(LLM)模型的评估协议。
  • 通过一个公开的 GitHub 仓库发布数据集、代码和排行榜,采用 CC BY-NC 4.0 许可。

实验结果

研究问题

  • RQ1当在大规模、真实的人与人之间的语音-文本数据集上评估时,模型在语音任务导向对话中的表现与在书面文本基准上的表现有何差异?
  • RQ2当前最先进模型在处理跨轮次槽位检测时的性能如何,其中槽位信息分布在多个对话轮次中?
  • RQ3模型能否有效检测需要间接推理而非直接槽位提取的推理槽位?
  • RQ4在具有自然语音特征和不完整语句的现实语音对话基准上,当前对话状态追踪器和端到端模型的性能极限是什么?
  • RQ5双模态模型(语音+文本)与纯文本模型相比,在捕捉语音细微差别和提升现实场景下的鲁棒性方面表现如何?

主要发现

  • 最先进的对话状态追踪器在 SpokenWOZ 基准上的联合目标准确率仅为 25.65%,表明语音对话状态追踪仍有巨大改进空间。
  • 最佳端到端模型仅在 52.1% 的对话中成功完成用户请求,凸显当前模型与人类水平性能在语音任务导向场景中的差距。
  • 即使同时使用语音和文本模态,现有双模态模型在处理语音对话中常见的不完整或碎片化语句方面仍表现吃力。
  • 引入跨轮次槽位检测任务揭示出,当前模型在追踪跨越多个轮次的槽位方面表现不佳,尤其是在语句被中断或部分说出时。
  • 推理槽位检测尤其具有挑战性,因为模型常误解间接或隐含的用户请求,凸显了在语音对话系统中提升推理与上下文理解能力的迫切需求。
  • 该数据集的高质量标注和真实的语音模式使其成为未来研究的坚实基础,有望推动实现更稳健、类人表现的语音对话代理的发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。