Skip to main content
QUICK REVIEW

[论文解读] IndicNLG Benchmark: Multilingual Datasets for Diverse NLG Tasks in Indic Languages

Aman Kumar, Himani Shrotriya|arXiv (Cornell University)|Mar 10, 2022
Topic Modeling被引用 5
一句话总结

本文提出了IndicNLG基准,这是首个针对11种印度语言的综合性多语言NLG基准,涵盖五项多样化任务:人物传记生成、标题生成、摘要生成、改写生成和问题生成,共包含约800万个样本。作者通过网络爬取、维基百科信息框和反向翻译收集并整理了数据集,展示了在该数据集上微调的多语言及语言特定模型表现出色,为印度低资源语言的NLG树立了新标准。

ABSTRACT

Natural Language Generation (NLG) for non-English languages is hampered by the scarcity of datasets in these languages. In this paper, we present the IndicNLG Benchmark, a collection of datasets for benchmarking NLG for 11 Indic languages. We focus on five diverse tasks, namely, biography generation using Wikipedia infoboxes, news headline generation, sentence summarization, paraphrase generation and, question generation. We describe the created datasets and use them to benchmark the performance of several monolingual and multilingual baselines that leverage pre-trained sequence-to-sequence models. Our results exhibit the strong performance of multilingual language-specific pre-trained models, and the utility of models trained on our dataset for other related NLG tasks. Our dataset creation methods can be easily applied to modest-resource languages as they involve simple steps such as scraping news articles and Wikipedia infoboxes, light cleaning, and pivoting through machine translation data. To the best of our knowledge, the IndicNLG Benchmark is the first NLG benchmark for Indic languages and the most diverse multilingual NLG dataset, with approximately 8M examples across 5 tasks and 11 languages. The datasets and models are publicly available at https://ai4bharat.iitm.ac.in/indicnlg-suite.

研究动机与目标

  • 解决低资源印度语言高质量、多样化NLG数据集稀缺的问题。
  • 建立一个用于评估单语言和多语言序列到序列模型在多种NLG任务中表现的基准。
  • 通过统一的多语言数据集,实现跨相关NLG任务的迁移学习和零样本泛化。
  • 为其他低资源语言提供可扩展、可复现的数据集构建流程。

提出的方法

  • 通过网络爬取新闻文章和维基百科信息框,收集11种印度语言的数据。
  • 使用基于规则和NLP技术的方法对原始文本进行轻量级清洗和标准化。
  • 通过多语言机器翻译进行数据增强,以扩充低资源语言的训练数据。
  • 构建五项独立的NLG任务:人物传记生成、标题生成、句子摘要生成、改写生成和问题生成。
  • 在收集的数据集上微调单语言和多语言预训练序列到序列模型(如mBART、mT5)。
  • 使用自动指标(BLEU、ROUGE、BERTScore)和人工评估进行性能评估。

实验结果

研究问题

  • RQ1统一的多语言基准是否能提升低资源印度语言在多样化NLG任务中的性能与可迁移性?
  • RQ2多语言模型与语言特定模型在11种印度语言中生成高质量文本的表现如何比较?
  • RQ3通过反向翻译进行数据增强在多大程度上能提升低资源NLG任务的性能?
  • RQ4在IndicNLG基准上微调的模型是否能通过极少微调就泛化到相关NLG任务?
  • RQ5数据集规模和多样性在低资源环境下对NLG模型性能有何影响?

主要发现

  • IndicNLG基准包含约800万个样本,覆盖5项NLG任务和11种印度语言,是目前针对这些语言最全面的多语言NLG数据集。
  • 在基准上微调的多语言模型表现强劲,mT5和mBART在所有任务中均展现出具有竞争力的结果。
  • 对多语言模型进行语言特定的微调,相比零样本或仅使用多语言设置,能持续提升性能。
  • 从IndicNLG基准进行迁移学习,可在相关NLG任务上实现强大的零样本性能,证明了该数据集在迁移学习中的实用性。
  • 基于网络爬取、清洗和反向翻译的数据集构建流程,在低资源语言环境下被证明高效且可扩展。
  • 人工评估确认,基于该基准微调后生成的模型输出在流畅性和事实一致性方面表现良好,尤其在数据集上微调后更为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。