[论文解读] MDIA: A Benchmark for Multilingual Dialogue Generation in 46 Languages
该论文提出了mDIA,这是首个涵盖19个语系共46种语言的大规模多语言对话生成基准,数据源自2020年Reddit的对话。该研究评估了微调后的mT5和DialoGPT模型,发现mT5基模型在相关性(sacreBLEU、BertScore)方面表现更优,但多样性较低;尽管少样本和零样本泛化能力表现良好,但英语与低资源语言之间仍存在显著性能差距。
Owing to the lack of corpora for low-resource languages, current works on dialogue generation have mainly focused on English. In this paper, we present mDIA, the first large-scale multilingual benchmark for dialogue generation across low- to high-resource languages. It covers real-life conversations in 46 languages across 19 language families. We present baseline results obtained by fine-tuning the multilingual, non-dialogue-focused pre-trained model mT5 as well as English-centric, dialogue-focused pre-trained chatbot DialoGPT. The results show that mT5-based models perform better on sacreBLEU and BertScore but worse on diversity. Even though promising results are found in few-shot and zero-shot scenarios, there is a large gap between the generation quality in English and other languages. We hope that the release of mDIA could encourage more works on multilingual dialogue generation to promote language diversity.
研究动机与目标
- 解决多语言开放域对话生成领域缺乏大规模统一基准的问题,特别是针对低资源语言。
- 提供一个标准化的评估框架,用于比较不同语言和资源水平下的对话生成模型。
- 探究多语言预训练与微调策略在低资源环境下的有效性。
- 揭示高资源语言(如英语)与低资源语言在生成质量上的差异。
- 鼓励开展关于跨语言对话迁移及模型在不同语系间泛化能力的研究。
提出的方法
- 从Reddit 2020年全年的流量中收集真实对话,覆盖19个语系共46种语言。
- 将每种语言的对话轮次限制在最多12,000轮,以模拟低资源场景。
- 对mT5进行微调,该模型是基于101种语言预训练的多语言非对话优化模型,用于对话生成。
- 将DialoGPT(以英语为中心、面向对话的模型)在多语言数据上进行微调,以评估零样本和少样本迁移能力。
- 通过MarianMT进行多语言翻译,以增强低资源语言的训练数据。
- 使用sacreBLEU、BERTScore(B-2、B-4)以及多样性指标(Distinct-2、Distinct-4、熵)评估模型性能。
实验结果
研究问题
- RQ1mT5等多语言模型与DialoGPT等英语专用模型在46种资源水平各异的语言上的对话生成表现如何?
- RQ2单一多语言模型在零样本或少样本设置下,对未见语言的泛化能力有多强?
- RQ3多语言对话生成中,响应相关性与多样性之间的权衡关系如何?
- RQ4在混合语言数据上进行微调,对高资源与低资源语言的性能有何影响?
- RQ5多语言对话生成中,英语与其他语言之间的性能差距有多大?
主要发现
- mT5基模型在sacreBLEU和BERTScore上均优于DialoGPT基模型,表明其在所有语言中均具有更好的响应相关性。
- 尽管相关性更优,mT5基模型生成的响应多样性较低,表现为Distinct-2和Distinct-4得分更低。
- DialoGPT基模型虽然多样性更高,但相关性较低,尤其在低资源语言中表现更差。
- 单一多语言mT5模型能有效泛化到未见语言,在混合语言设置下仍能生成有效响应。
- 英语与其他语言之间仍存在显著性能差距,英语在所有指标上的生成质量均显著优于其他语言。
- 低资源语言在使用多语言数据微调后仅获得微弱提升,而高资源语言的性能则基本不受此类微调影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。