Skip to main content
QUICK REVIEW

[論文レビュー] IndicBART: A Pre-trained Model for Natural Language Generation of Indic Languages.

Raj Dabre, Himani Shrotriya|arXiv (Cornell University)|Sep 7, 2021
Natural Language Processing Techniques参考文献 43被引用数 13
ひとこと要約

IndicBART は、11 種類のインディカ言語と英語を対象とした多言語的シーケンス・ツー・シーケンス事前学習モデルであり、デヴァナガリー系の書記体系に共通する表記的類似性を活用して、多言語間転送性能を向上させている。スクリプト統合と多言語的ファインチューニングにより、パラメータ数が著しく少ないにもかかわらず、mBART50 よりも競争的または優れた性能を示しており、ニューラル機械翻訳およびエクストリーム要約のタスクで優れた結果を達成している。

ABSTRACT

In this paper we present IndicBART, a multilingual, sequence-to-sequence pre-trained model focusing on 11 Indic languages and English. Different from existing pre-trained models, IndicBART utilizes the orthographic similarity between Indic scripts to improve transfer learning between similar Indic languages. We evaluate IndicBART on two NLG tasks: Neural Machine Translation (NMT) and extreme summarization. Our experiments on NMT for 12 language pairs and extreme summarization for 7 languages using multilingual fine-tuning show that IndicBART is competitive with or better than mBART50 despite containing significantly fewer parameters. Our analyses focus on identifying the impact of script unification (to Devanagari), corpora size as well as multilingualism on the final performance. The IndicBART model is available under the MIT license at this https URL .

研究の動機と目的

  • 共通するスクリプト特徴を持つ低リソースのインディカ言語に特化した多言語的事前学習モデルの開発を目的とする。
  • デヴァナガリー由来のスクリプト間の表記的類似性が、低リソース環境下での転移学習にどのように寄与するかを調査すること。
  • 特にニューラル機械翻訳およびエクストリーム要約を含む自然言語生成タスクにおける性能を評価すること。
  • スクリプト統合、学習コーパスのサイズ、多言語性の影響がモデル効果性に与える影響を分析すること。
  • 広く研究や応用に利用できるよう、MIT ライセンスの下で高パフォーマンスでオープンソース化されたモデルをリリースすること。

提案手法

  • IndicBART は、11 種類のインディカ言語と英語の単語レベルのテキストを事前学習に使用した、シーケンス・ツー・シーケンス型のトランスフォーマー基盤モデルである。
  • 事前学習段階で、すべてのインディカスクリプトを統一されたデヴァナガリー表記に変換することで、表記的類似性を活用する。
  • ニューラル機械翻訳およびエクストリーム要約タスクの複数の言語ペアに対して、多言語的ファインチューニングを実施する。
  • マスクド自己符号化とノイズ除去の目的関数を用いて学習を行うが、スクリプトに依存しない表現学習に適応させた。
  • BLEU や ROUGE といった標準的な NLG 評価指標を用いて性能を評価し、スクリプト統合とコーパスサイズに関するアブレーションスタディを実施する。
  • MIT ライセンスの下でオープンアクセスおよびコミュニティ利用を目的としてリリースする。

実験結果

リサーチクエスチョン

  • RQ1デヴァナガリー表記へのスクリプト統合が、インディカ言語の多言語的事前学習における多言語間転送性能に、どの程度向上効果をもたらすか?
  • RQ2mBART50 と比較して、パラメータ数の少ないインディカ言語生成タスクにおける性能は、どのように差がつくか?
  • RQ3学習コーパスのサイズが、さまざまなインディカ言語における IndicBART の性能に与える影響は何か?
  • RQ4多言語的ファインチューニングは、ニューラル機械翻訳およびエクストリーム要約タスクの性能にどのように影響するか?
  • RQ5スクリプト統合された小さなモデルが、mBART50 のような大きな多言語モデルを上回る性能を発揮できるか?

主な発見

  • IndicBART は、パラメータ数が著しく少ないにもかかわらず、12 組のニューラル機械翻訳ペアにおいて mBART50 と同等または優れた性能を達成している。
  • 共通するスクリプト表現のおかげで、特に低リソース言語ペアにおいて、ゼロショット転送性能が顕著に高い。
  • デヴァナガリー表記へのスクリプト統合により、7 種類のインディカ言語におけるエクストリーム要約タスクの性能が顕著に向上し、表記の整合性の有効性が裏付けられた。
  • より大きな学習コーパスは性能向上に寄与するが、スクリプト統合と多言語的事前学習と組み合わせると、その恩恵が顕著に現れる。
  • 多言語的ファインチューニングは、すべての評価タスクで一貫して汎化性能を向上させ、共有表現学習の有効性を確認した。
  • MIT ライセンスの下でのオープンソース化により、インドの言語における低リソース NLP 研究分野での広範な採用と応用が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。