[论文解读] MTOP: A Comprehensive Multilingual Task-Oriented Semantic Parsing Benchmark
本文提出 MTOP,一个涵盖 6 种语言和 11 个领域的多语言任务导向语义解析基准,包含 10 万条语句,支持扁平化和复合式槽位表示。该研究利用多语言预训练模型(如 XLM-R 和 mBART)实现了最先进性能,在现有数据集上 F1 分数提升 6.3 个百分点,并在无目标语言数据的情况下实现了 67.2% 的精确匹配准确率,完成零样本跨语言迁移。
Scaling semantic parsing models for task-oriented dialog systems to new languages is often expensive and time-consuming due to the lack of available datasets. Available datasets suffer from several shortcomings: a) they contain few languages b) they contain small amounts of labeled examples per language c) they are based on the simple intent and slot detection paradigm for non-compositional queries. In this paper, we present a new multilingual dataset, called MTOP, comprising of 100k annotated utterances in 6 languages across 11 domains. We use this dataset and other publicly available datasets to conduct a comprehensive benchmarking study on using various state-of-the-art multilingual pre-trained models for task-oriented semantic parsing. We achieve an average improvement of +6.3 points on Slot F1 for the two existing multilingual datasets, over best results reported in their experiments. Furthermore, we demonstrate strong zero-shot performance using pre-trained models combined with automatic translation and alignment, and a proposed distant supervision method to reduce the noise in slot label projection.
研究动机与目标
- 解决低资源语言在多样性和多语言性方面,任务导向语义解析数据集匮乏的问题。
- 实现对多语言预训练模型在多种语言中复杂嵌套查询上的系统性评估。
- 通过自动翻译与远程监督,提升语义解析的零样本跨语言迁移性能。
- 基于最先进多语言模型,为 6 种语言的扁平化与复合式语义解析建立强基线。
- 证明多语言预训练相比单语言微调显著提升性能,尤其在结合数据增强技术时效果更明显。
提出的方法
- 发布 MTOP,一个全新的多语言数据集,包含 6 种语言(英语、德语、西班牙语、法语、土耳其语、泰语)的 10 万条标注语句,覆盖 11 个领域,支持扁平化与复合式(分层)槽位表示。
- 使用多语言预训练模型(mBERT、XLM-R、mBART、CRISS、MARGE)对扁平化与复合式语义解析任务进行微调。
- 通过自动机器翻译与跨语言词对齐,生成用于零样本迁移的合成训练数据。
- 提出一种远程监督方法,通过利用跨语言嵌入与对齐,减少从翻译数据中投影槽位标签的噪声。
- 实施一种掩码数据增强策略,将掩码标记替换为对应翻译,以提升泛化能力。
- 通过在源语言数据上微调英语模型,并在无任何目标语言标注的情况下评估目标语言性能,开展零样本评估。
实验结果
研究问题
- RQ1多语言预训练模型是否能在不微调目标语言数据的情况下,在多种语言上实现强大的零样本语义解析性能?
- RQ2自动翻译与跨语言对齐相结合,在提升语义解析零样本迁移性能方面效果如何?
- RQ3结合对齐嵌入的远程监督是否能减少投影槽位标签的噪声并提升零样本性能?
- RQ4不同多语言模型(如 XLM-R、mBART、CRISS)在多种语言中,对复合式与扁平化语义解析任务的性能表现如何比较?
- RQ5与单语言微调相比,多语言预训练在低资源语言上的泛化能力提升程度如何?
主要发现
- 所提出的远程监督方法显著减少了从翻译数据中投影槽位标签的噪声,提升了零样本性能。
- XLM-R 搭配掩码数据增强与翻译对齐,在 5 种语言上的零样本跨语言迁移中达到 67.2% 的精确匹配准确率,接近在语言内模型的 77.7% 性能。
- 基于 XLM-R 的模型在现有多语言数据集(Multilingual ATIS 和 Multilingual TOP)上相比以往最佳结果,F1 分数提升 6.3 个百分点。
- mBART 初始零样本性能较差,但在多语言翻译任务上微调后显著提升,表明其初始训练不足。
- XLM-R 与 CRISS 在 5 种语言中表现最佳,其中 XLM-R 在泰语上表现最优,因其在预训练中包含泰语。
- 翻译导致的分词不匹配在泰语及其他非空格分隔语言中造成性能下降,凸显了零样本迁移中的关键挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。