Skip to main content
QUICK REVIEW

[论文解读] Multi3WOZ: A Multilingual, Multi-Domain, Multi-Parallel Dataset for Training and Evaluating Culturally Adapted Task-Oriented Dialog Systems

Songbo Hu, Han Zhou|arXiv (Cornell University)|Jul 26, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本文介绍了 Multi3WOZ,一个大规模、多语言、多领域、多语种并行的任务导向对话数据集,涵盖英语、阿拉伯语、法语和土耳其语,通过自下而上的、基于提纲的数据收集流程创建,以确保文化适应性和语言真实性。该数据集支持在 NLU、DST、NLG 和端到端任务中对单语、多语及跨语言 ToD 系统进行训练与评估,基线结果表明,各语言之间存在显著性能差距,尤其在法语和土耳其语等低资源语言与英语相比表现更差。

ABSTRACT

Creating high-quality annotated data for task-oriented dialog (ToD) is known to be notoriously difficult, and the challenges are amplified when the goal is to create equitable, culturally adapted, and large-scale ToD datasets for multiple languages. Therefore, the current datasets are still very scarce and suffer from limitations such as translation-based non-native dialogs with translation artefacts, small scale, or lack of cultural adaptation, among others. In this work, we first take stock of the current landscape of multilingual ToD datasets, offering a systematic overview of their properties and limitations. Aiming to reduce all the detected limitations, we then introduce Multi3WOZ, a novel multilingual, multi-domain, multi-parallel ToD dataset. It is large-scale and offers culturally adapted dialogs in 4 languages to enable training and evaluation of multilingual and cross-lingual ToD systems. We describe a complex bottom-up data collection process that yielded the final dataset, and offer the first sets of baseline scores across different ToD-related tasks for future reference, also highlighting its challenging nature.

研究动机与目标

  • 为解决现有多语言任务导向对话数据集的局限性,包括翻译带来的偏差、规模小、缺乏文化适应性以及多语言并行性不足的问题。
  • 创建一个大规模、高质量且文化本地化的多语言 ToD 数据集,支持在单语、多语和跨语言设置下对多个 NLP 任务(NLU、DST、NLG、E2E)进行训练与评估。
  • 通过引入自下而上的、基于提纲的方法,克服对翻译式数据构建的依赖,实现抽象对话框架与语言特异性表达形式的解耦。
  • 通过四种语言间同步的多语种并行对话流,实现有意义的跨语言比较与迁移学习。
  • 为未来研究和对比分析提供首个涵盖多个 ToD 任务的完整基线分数集合。

提出的方法

  • 采用受 Majewska 等人(2023)启发的自下而上、基于提纲的方法构建数据集,即先创建语言无关的对话框架(提纲),再由母语者独立地在每种目标语言中实现为自然且文化适配的语句。
  • 每个对话围绕一组固定的领域(如餐厅、酒店、出租车)构建,每一轮对话均由母语者手动编写,以反映各语言在现实世界中的文化与语言规范。
  • 数据收集过程确保了多语种并行性:每个对话流在所有四种语言(英语、阿拉伯语、法语、土耳其语)中均被保留,从而支持直接的跨语言比较与迁移学习。
  • 最终数据集包含每种语言 7,440 个训练对话、860 个开发对话和 860 个测试对话,总计约 494,116 个对话轮次,且在 NLU、DST 和 NLG 任务中保持一致的标注。
  • 基线模型采用 mT5-large 作为主干网络用于 DST 和响应生成(RG),输入为历史对话、预测状态和数据库摘要的拼接,输出为去标识化响应。
  • 评估遵循标准 ToD 指标:信息率(Inform Rate)、成功率(Success Rate)和去标识化响应的 BLEU 分数,实验在单张 A100 GPU 上进行,批量大小为 4,训练周期为 5 个 epoch。

实验结果

研究问题

  • RQ1如何系统性地构建一个大规模、文化适配的多语言 ToD 数据集,以避免基于翻译的偏差,并确保多种语言间的语言真实性?
  • RQ2在端到端 ToD 系统中,语言间的性能差异(如英语 vs. 法语/土耳其语)在多大程度上显现?其背后的影响因素是什么?
  • RQ3基于提纲的自下而上数据收集框架在多语言环境下是否能有效扩展,同时保持对话连贯性与文化相关性?
  • RQ4在大规模、多语种并行的 ToD 数据集上,多语言与跨语言迁移学习设置相较于单语基线表现如何?
  • RQ5在多语言设置下,关键 ToD 任务(NLU、DST、NLG、E2E)的基线性能水平如何?不同语言之间的表现差异如何?

主要发现

  • Multi3WOZ 数据集在四种语言(英语、阿拉伯语、法语、土耳其语)中包含 494,116 个对话轮次,每种语言有 7,440 个训练对话、860 个开发对话和 860 个测试对话,确保了均衡且可扩展的多语言覆盖。
  • 使用 mT5-large 的完全监督端到端模型在所有语言上平均获得 57.1% 的信息率、29.8% 的成功率和 14.6% 的 BLEU 分数,低资源语言如法语和土耳其语表现出显著性能下降。
  • 英语表现显著优于其他语言,信息率为 67.9%,成功率 39.0%;而法语和土耳其语的信息率分别为 47.9% 和 45.9%,表明存在强烈的语言资源偏差。
  • mT5-large 模型在信息率上比 mT5-small 提升 16.4 分,成功率提升 17.2 分,BLEU 提升 4.6 分,表明模型规模对性能有显著提升作用。
  • Multi3WOZ 的多语种并行与文化适配设计使得有意义的跨语言分析与迁移学习成为可能,且已为未来对比研究提供了基线分数。
  • 基于提纲的数据收集方法在大规模场景下被证明是可行且高效的,生成了高质量、接近母语水平的对话,完全避免了翻译腔和人工痕迹。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。