Skip to main content
QUICK REVIEW

[論文レビュー] ALBETO and DistilBETO: Lightweight Spanish Language Models

José Cañete, Sebastián Donoso|arXiv (Cornell University)|Apr 19, 2022
Natural Language Processing Techniques被引用数 10
ひとこと要約

本稿では、ALBERTおよびDistilBERTアーキテクチャに基づき、スペイン語コーパスに特化して事前学習された軽量なスペイン語言語モデル、ALBETOおよびDistilBETOを紹介する。パラメータ数が著しく少ないにもかかわらず(最大22倍少ない)、ALBETO tinyはBETOの87%の性能を達成し、ALBETO baseはパラメータ数が9倍少ないにもかかわらず97%の性能に達する。これはMLQA、XQuAD、XNLIを含む複数のGLUEベンチマークタスクでBETOを上回る性能を示した。

ABSTRACT

In recent years there have been considerable advances in pre-trained language models, where non-English language versions have also been made available. Due to their increasing use, many lightweight versions of these models (with reduced parameters) have also been released to speed up training and inference times. However, versions of these lighter models (e.g., ALBERT, DistilBERT) for languages other than English are still scarce. In this paper we present ALBETO and DistilBETO, which are versions of ALBERT and DistilBERT pre-trained exclusively on Spanish corpora. We train several versions of ALBETO ranging from 5M to 223M parameters and one of DistilBETO with 67M parameters. We evaluate our models in the GLUES benchmark that includes various natural language understanding tasks in Spanish. The results show that our lightweight models achieve competitive results to those of BETO (Spanish-BERT) despite having fewer parameters. More specifically, our larger ALBETO model outperforms all other models on the MLDoc, PAWS-X, XNLI, MLQA, SQAC and XQuAD datasets. However, BETO remains unbeaten for POS and NER. As a further contribution, all models are publicly available to the community for future research.

研究の動機と目的

  • BETOのような大規模モデルに代わる、より小さく高速な代替モデルを提供することで、スペイン語向けの効率的で軽量な言語モデルの不足を解消すること。
  • モバイルデバイスやウェブサービスなどの低リソース環境やリアルタイム応用において、スペイン語の最先端NLPモデルへのアクセスを向上させること。
  • テキスト分類、質問応答、固有表現認識を含む多様なNLPタスクにおけるこれらのモデルのパフォーマンスを評価すること。
  • 研究およびスペイン語NLP分野の発展を支援するため、公開可能なファインチューニング済みモデルとコードを提供すること。

提案手法

  • 重みの共有を用いてパラメータ数を削減するALBERTアーキテクチャに基づき、ALBETOバリアント(tiny、base、large、xlarge、xxlarge)を事前学習する。
  • 知識蒸留を用いてBETOモデルをより小さく、高速化されたバージョンに圧縮するDistilBETOを訓練する。
  • すべての事前学習に大規模な単一言語スペイン語コーパスを用い、言語固有の最適化を実現する。
  • MLDoc、PAWS-X、XNLI、MLQA、SQAC、XQuADを含むGLUEベンチマークの複数のスペイン語NLPタスクで、すべてのモデルをファインチューニングする。
  • F1スコア、正確一致率、正答率といった標準的な指標を用いて、すべてのタスクでパフォーマンスを評価する。
  • Hugging FaceおよびGitHubを通じて、すべてのモデルとファインチューニングコードを公開し、コミュニティへのアクセスと再現可能性を確保する。

実験結果

リサーチクエスチョン

  • RQ1軽量なALBERTおよびDistilBERTバリアントは、BETOに比べて著しく少ないパラメータ数でスペイン語NLPタスクにおいて競争力のあるパフォーマンスを達成できるか?
  • RQ2スペイン語の質問応答や自然言語推論などの下流タスクにおいて、モデルの効率性(パラメータ数)とパフォーマンスの相関関係は何か?
  • RQ3BETO casedは、大文字・小文字の区別により、POSやNERのようなタスクで性能優位性を維持しているのか?また、軽量モデルとの比較ではどうなるか?
  • RQ4知識蒸留とパラメータ共有戦略を用いることで、BETOをより軽量なモデルに圧縮する際に、性能をどの程度維持できるか?
  • RQ5これらの軽量モデルは、低リソース環境や推論制約のある環境において、BETOの実用的代替として十分に機能するか?

主な発見

  • ALBETO tinyはGLUEベンチマークでBETOの87%のパフォーマンスを達成し、パラメータ数は22倍少ない。
  • ALBETO baseはパラメータ数が9倍以上少ないにもかかわらず、BETOの97%のパフォーマンスに達した。
  • ALBETO xxlargeはMLQA(F1スコア2.5ポイント高い)、SQAC(2.8ポイント高い)、XQuAD(2.3ポイント高い)でBETO casedを上回った。
  • XNLIタスクでは、ALBETO xxlargeがF1スコア82.42を達成し、BETO casedを0.5ポイント上回った。
  • POSおよびNERタスクでは、BETO casedが依然としてすべての軽量モデルを上回ったが、特に大文字・小文字の区別による利点が顕著であった。一方、ALBETOモデルは非常に高いパフォーマンスを示した。
  • DistilBETOおよびすべてのALBETOバリアントは、ファインチューニング済み重みとトレーニングコードとともに公開されており、広範なコミュニティ利用が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。