Skip to main content
QUICK REVIEW

[論文レビュー] On the Multilingual Capabilities of Very Large-Scale English Language Models

Jordi Armengol-Estapé, Ona De Gibert Bonet|arXiv (Cornell University)|Aug 30, 2021
Topic Modeling被引用数 4
ひとこと要約

この論文は、大規模な英語専用言語モデルであるGPT-3のゼロショット多言語能力を調査し、訓練データのうちたった0.01798%を占める低リソース言語であるカタラーノ語に焦点を当てている。最小限の露出にもかかわらず、GPT-3は自然言語生成および要約抽出型質問応答の両方で優れたパフォーマンスを示し、最大のモデルバリアントでF1スコアが65.8%に達した。これは、低リソース環境下でも顕著なクロスリンガル転送が可能であることを示している。

ABSTRACT

Generative Pre-trained Transformers (GPTs) have recently been scaled to unprecedented sizes in the history of machine learning. These models, solely trained on the language modeling objective, have been shown to exhibit outstanding few-shot learning capabilities in a number of different tasks. Nevertheless, aside from anecdotal experiences, little is known regarding their multilingual capabilities, given the fact that the pre-training corpus is almost entirely composed of English text. In this work, we investigate the multilingual skills of GPT-3, focusing on one language that barely appears in the pre-training corpus, Catalan, which makes the results especially meaningful; we assume that our results may be relevant for other languages as well. We find that the model shows an outstanding performance, particularly in generative tasks, with predictable limitations mostly in language understanding tasks but still with remarkable results given the zero-shot scenario. We investigate its potential and limits in extractive question-answering and natural language generation, as well as the effect of scale in terms of model size.

研究の動機と目的

  • GPT-3のゼロショット多言語能力を、Pre-trainingコーパスのうちたった0.01798%を占める低リソース言語のカタラーノ語において評価すること。
  • 非常に大規模な英語言語モデルが、ファインチューニングや明示的な多言語事前学習を経ずに他の言語に一般化できるかどうかを評価すること。
  • 自然言語理解および生成タスクにおけるクロスリンガル転送パフォーマンスに与えるモデルスケールの影響を調査すること。
  • 特に計算コストとトークン化の非効率性という観点から、GPT-3の非英語言語への実用的利便性を検討すること。

提案手法

  • 本研究では、要約抽出型質問応答および自然言語生成タスクにおいて、カタラーノ語を用いたゼロショットプロンプトを用いて、GPT-3を複数のモデルサイズ(text-davinci-002、text-curie-001など)で評価した。
  • 要約抽出型質問応答のため、モデルは文脈と質問のペアをプロンプトとして入力し、予測結果はF1スコアおよびエクサクトマッチスコアで評価された。
  • 自然言語生成のため、GPT-3は見出しまたは部分文をプロンプトとして入力し、一貫性のあるカタラーノ語のテキストを生成した。その後、5段階スケールで人間によるアノテーションで評価された。
  • 人間評価では、1サンプルあたり3名のアノテーターが関与し、信頼性を確保した。統計的有意性はt検定を用いて検証された。
  • 分析では、GPT-3のパフォーマンスを人間が作成したコントロールセットと比較し、流暢さ、一貫性、意味的正確性に注目した。
  • スケーリングカーブをプロットし、モデルサイズとゼロショットクロスリンガル転送パフォーマンスの関係を分析した。

実験結果

リサーチクエスチョン

  • RQ1GPT-3は、Pre-trainingデータにほとんど存在しないにもかかわらず、カタラーノ語におけるゼロショット自然言語理解および生成を実行できるか?
  • RQ2モデルサイズが、低リソース言語におけるゼロショット多言語タスクのGPT-3パフォーマンスにどのように影響するか?
  • RQ3GPT-3のカタラーノ語出力は、流暢さと一貫性の観点から、人間が生成したテキストと比べてどの程度のパフォーマンスを示すか?
  • RQ4GPT-3のカタラーノ語出力における主な失敗モードとエラーパattersは何か?
  • RQ5言語的類縁性および構造的普遍性は、GPT-3で観察されたクロスリンガル転送をどの程度説明できるか?

主な発見

  • 最大のモデルバリアント(text-davinci-002)を用いたカタラーノ語の要約抽出型質問応答で、F1スコアが65.8%に達し、強いゼロショットNLU能力を示した。
  • 自然言語生成タスクでは、GPT-3の出力は平均して5段階中3.83点(人間コントロールの4.49点より有意に低い、p = 0.00026)のスコアを得たが、ゼロショット設定であるにもかかわらず依然として高い水準であった。
  • 平均スコアが低くても、GPT-3が出力した文の33.33%は人間コントロールの平均を超えて評価され、21.6%は文法的に正しいが意味的に特異的であった。
  • 地域特化した見出しをプロンプトとして与えた際、GPT-3はバリエンシア語というカタラーノ語の方言を驚くほど一貫して生成することができ、方言差に内蔵された適応性を示した。
  • スケーリングカーブでは、カタラーノ語のPre-trainingデータが一定であっても、モデルサイズの増加に伴いパフォーマンスが著しく向上しており、クロスリンガル転送における強力なスケーリング法則が確認された。
  • 小規模なGPT-3バリアントは、トークン化の非効率性と長大なシーケンス長のため、カタラーノ語用途では計算的に実用的でないことが判明し、低リソース言語における主要なバリアントとなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。