QUICK REVIEW
[论文解读] Multilingual Synthetic Question and Answer Generation for Cross-Lingual Reading Comprehension.
Siamak Shakeri, Noah Constant|arXiv (Cornell University)|Oct 22, 2020
Topic Modeling参考文献 10被引用 7
一句话总结
本文提出一种单一生成模型,通过利用自动翻译的英语数据,生成大规模多语言问答对,从而无需在目标语言中进行人工标注。该方法通过合成数据增强,在多个数据集上显著提升了多语言问答性能。
ABSTRACT
We propose a simple method to generate large amounts of multilingual question and answer pairs by a single generative model. These synthetic samples are then applied to augment the available gold multilingual ones to improve the performance of multilingual QA models on target languages. Our approach only requires existence of automatically translated samples from English to the target domain, thus removing the need for human annotations in the target languages. Experimental results show our proposed approach achieves significant gains in a number of multilingual datasets.
研究动机与目标
- 解决低资源语言中多语言问答标注数据稀缺的问题。
- 减少多语言问答任务中对目标语言昂贵人工标注数据的依赖。
- 通过从英语翻译生成的合成数据,提升跨语言阅读理解性能。
- 开发一种可扩展的单一模型方法,用于多语言问答数据的生成。
提出的方法
- 在英语问答对上训练单一生成模型,以生成合成的多语言问答样本。
- 利用自动翻译的英语数据作为输入,生成目标语言的问题和答案。
- 通过在英语到目标语言的回译或翻译训练数据上微调模型,生成合成样本。
- 将生成的合成数据与现有的真实多语言数据结合,用于训练数据增强。
- 该方法完全依赖机器翻译进行数据生成,避免在目标语言中进行人工标注。
- 最终模型在合成数据与真实数据的组合数据上进行微调,以提升零样本和少样本的跨语言迁移能力。
实验结果
研究问题
- RQ1单一生成模型是否能在不依赖目标语言人工标注的情况下,生成高质量的多语言问答对?
- RQ2从英语翻译数据生成的合成数据在提升多语言问答性能方面的有效性如何?
- RQ3使用合成样本进行数据增强在多大程度上能提升零样本和少样本的跨语言迁移性能?
- RQ4该方法是否能在多样化的多语言问答数据集和低资源语言上实现良好泛化?
主要发现
- 所提出的方法仅使用自动翻译的英语数据,就在多个多语言问答基准测试中实现了显著的性能提升。
- 即使在真实数据稀缺的低资源语言设置中,合成数据生成也能提升模型性能。
- 该方法减少了对目标语言昂贵人工标注的依赖,同时保持或提升了模型的准确性。
- 该方法在多种语言和数据集上均表现出强大的零样本和少样本泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。