[论文解读] GlobalWoZ: Globalizing MultiWoZ to Develop Multilingual Task-Oriented Dialogue Systems
本文提出了GlobalWoZ,一个大规模多语言任务导向对话数据集,通过将MultiWoZ中的对话模板翻译成20种语言,并使用目标语言国家的本地相关实体进行填充而构建。该方法实现了三种未探索的应用场景——F&F、F&E和E&F的逼真零样本跨语言迁移,表明在本地化实体上进行训练可显著提升对话状态追踪性能,优于直接翻译基线方法。
Much recent progress in task-oriented dialogue (ToD) systems has been driven by available annotation data across multiple domains for training. Over the last few years, there has been a move towards data curation for multilingual ToD systems that are applicable to serve people speaking different languages. However, existing multilingual ToD datasets either have a limited coverage of languages due to the high cost of data curation, or ignore the fact that dialogue entities barely exist in countries speaking these languages. To tackle these limitations, we introduce a novel data curation method that generates GlobalWoZ -- a large-scale multilingual ToD dataset globalized from an English ToD dataset for three unexplored use cases. Our method is based on translating dialogue templates and filling them with local entities in the target-language countries. We release our dataset as well as a set of strong baselines to encourage research on learning multilingual ToD systems for real use cases.
研究动机与目标
- 为解决缺乏真实反映跨语言旅行场景的多语言任务导向对话(ToD)数据集的问题。
- 克服现有数据集仅使用英语或在未本地化实体的情况下进行翻译所带来的局限性,从而提升实际应用的可行性。
- 提出一种成本效益高的数据整理方法,通过机器翻译和本地实体挖掘,将英语ToD数据集(MultiWoZ)全球化为20种语言。
- 评估多语言预训练模型在新数据集上进行零样本和少样本跨语言迁移的有效性。
- 发布GlobalWoZ及强基线模型,以推动多语言ToD系统在真实世界部署中的研究进展。
提出的方法
- 使用神经机器翻译将MultiWoZ中的对话模板翻译成20种目标语言。
- 利用爬取的本体和本地知识源,将英文命名实体替换为对应目标语言国家的本地相关实体。
- 仅进行少量人工后编辑(数百个模板),以确保目标语言的流畅性和正确性。
- 构建三种不同的应用场景:F&F(外国人在外国)、F&E(外国人在英语国家)、E&F(英语人在外国),与传统的E&E场景不同。
- 在新数据集上,采用零样本和少样本跨语言迁移设置训练并评估多语言ToD模型。
- 使用Spearman等级相关系数验证模型在MT和MTPE(机器翻译加后编辑)测试集上的性能一致性。
实验结果
研究问题
- RQ1与传统的E&E场景相比,多语言ToD模型在不同跨语言应用场景(F&F、F&E、E&F)中的表现有何差异?
- RQ2在目标语言中使用真实本地化实体,相较于直接翻译实体,能在多大程度上提升对话状态追踪的准确性?
- RQ3多语言预训练模型能否在像GlobalWoZ这样全球整理的数据集上有效泛化至零样本跨语言迁移?
- RQ4当本地上下文和实体使用不同文字系统(如拉丁字母与非拉丁字母)时,文字类型对模型性能有何影响?
- RQ5在泰语和越南语等低资源语言中,模型的失败模式是什么,它们如何影响模型性能?
主要发现
- SUC基线在中文F&F测试数据上达到36.97%的联合准确率,显著优于零样本E&E基线(1.22%)和Translate-Train(2.61%),证明了本地化实体的重要性。
- 在F&E场景中,SUC在西班牙语测试数据上达到56.28%的联合准确率,远超零样本基线(6.92%)和Translate-Train(2.28%),证实了本地实体训练的优势。
- 对于泰语和越南语,性能显著下降(例如,泰语E&F场景中仅为3.06%),原因是未能正确预测声调符号,表明需要后处理或专用模型。
- MT与MTPE测试结果之间的Spearman等级相关系数在所有语言中均为1.00,表明模型排名一致,评估设置可靠。
- 当本地实体和上下文使用相同文字系统(如拉丁字母)时,使用本地实体比仅使用本地上下文更有效;但当文字系统不同时,本地上下文变得更为关键,凸显了文字对齐的作用。
- MBUC方法在英语F2E场景中达到60.48%的联合准确率,优于SUC(57.10%)和BBUC(59.05%),表明其在零样本设置下具有更强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。