Skip to main content
QUICK REVIEW

[論文レビュー] IndicNLG Benchmark: Multilingual Datasets for Diverse NLG Tasks in Indic Languages

Aman Kumar, Himani Shrotriya|arXiv (Cornell University)|Mar 10, 2022
Topic Modeling被引用数 5
ひとこと要約

本稿では、11のインド諸言語を対象とした、5つの多様なタスク(人物紹介文生成、見出し生成、要約、並び替え表現生成、質問生成)にわたる約800万例のデータを含む、インド諸言語向けの包括的で多言語対応のNLGベンチマーク「IndicNLG Benchmark」を紹介する。著者らは、ウェブスクレイピング、Wikipediaのインフォボックス、およびバックトランスレーションを用いてデータを収集・整備し、そのデータで微調整された多言語モデルおよび言語特化モデルの優れた性能を示した。これにより、インド諸言語における低リソースNLGの新たな基準が確立された。

ABSTRACT

Natural Language Generation (NLG) for non-English languages is hampered by the scarcity of datasets in these languages. In this paper, we present the IndicNLG Benchmark, a collection of datasets for benchmarking NLG for 11 Indic languages. We focus on five diverse tasks, namely, biography generation using Wikipedia infoboxes, news headline generation, sentence summarization, paraphrase generation and, question generation. We describe the created datasets and use them to benchmark the performance of several monolingual and multilingual baselines that leverage pre-trained sequence-to-sequence models. Our results exhibit the strong performance of multilingual language-specific pre-trained models, and the utility of models trained on our dataset for other related NLG tasks. Our dataset creation methods can be easily applied to modest-resource languages as they involve simple steps such as scraping news articles and Wikipedia infoboxes, light cleaning, and pivoting through machine translation data. To the best of our knowledge, the IndicNLG Benchmark is the first NLG benchmark for Indic languages and the most diverse multilingual NLG dataset, with approximately 8M examples across 5 tasks and 11 languages. The datasets and models are publicly available at https://ai4bharat.iitm.ac.in/indicnlg-suite.

研究の動機と目的

  • 低リソースのインド諸言語向けに、高品質で多様なNLGデータセットが不足している問題に対処すること。
  • 複数のNLGタスクにおいて、単言語および多言語のシーケンス・ツー・シーケンスモデルを評価するためのベンチマークを確立すること。
  • 統一された多言語データセットを用いて、関連するNLGタスク間での転移学習およびゼロショット一般化を可能にすること。
  • 他の低リソース言語に対しても同様のデータセット作成が可能で、再現性のあるスケーラブルなパイプラインを提供すること。

提案手法

  • 11のインド諸言語のニュース記事およびWikipediaインフォボックスのウェブスクレイピングによるデータ収集。
  • ルールベースおよびNLP技術を用いたテキストの軽微なクリーニングと正規化。
  • 低リソース言語向けのトレーニングデータ拡張のため、多言語機械翻訳を活用したピボット処理。
  • 5つの異なるNLGタスクの構築:人物紹介文生成、見出し生成、文の要約、並び替え表現生成、質問生成。
  • 収集したデータセット上で、単言語および多言語事前学習済みシーケンス・ツー・シーケンスモデル(例:mBART、mT5)の微調整。
  • 自動評価指標(BLEU、ROUGE、BERTScore)と人的評価を用いた品質評価による評価。

実験結果

リサーチクエスチョン

  • RQ1統一された多言語ベンチマークは、低リソースのインド諸言語における多様なNLGタスクのパフォーマンスと転移性を向上させることができるか?
  • RQ2多言語モデルと言語特化モデルは、11のインド諸言語において、高品質なテキスト生成をどの程度効果的に実現できるか?
  • RQ3バックトランスレーションによるデータ拡張は、低リソースNLGタスクのパフォーマンスをどの程度向上させることができるか?
  • RQ4IndicNLG Benchmarkで微調整されたモデルは、最小限の微調整で関連するNLGタスクに一般化できるか?
  • RQ5データセットの規模と多様性は、低リソース環境下でのNLGモデルパフォーマンスにどのような影響を及ぼすか?

主な発見

  • IndicNLG Benchmarkは、11のインド諸言語と5つのNLGタスクにわたって約800万例のデータを含み、これらの言語向けで最も包括的な多言語NLGデータセットである。
  • ベンチマークで微調整された多言語モデルは強力なパフォーマンスを示し、mT5やmBARTは全タスクで競争力のある結果を達成した。
  • 多言語モデルの言語特化型微調整は、ゼロショットまたは多言語のみの設定よりも一貫した改善をもたらした。
  • IndicNLG Benchmarkからの転移学習により、関連するNLGタスクで強力なゼロショットパフォーマンスが達成されたことから、このデータセットが転移学習に有効であることが示された。
  • スクレイピング、クリーニング、バックトランスレーションに基づくデータ収集パイプラインは、低リソース言語環境において効果的でスケーラブルであることが実証された。
  • 人的評価により、このベンチマーク上で生成されたモデル出力は、微調整が施された場合、特に流暢さと事実の整合性に優れていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。