Skip to main content
QUICK REVIEW

[論文レビュー] Large Pre-Trained Models with Extra-Large Vocabularies: A Contrastive Analysis of Hebrew BERT Models and a New One to Outperform Them All

Eylon Guetta, Avi Shmidman|arXiv (Cornell University)|Nov 28, 2022
Natural Language Processing Techniques被引用数 5
ひとこと要約

本論文は、128K語彙を備えた現代ヘブライ語向けの新しい大規模事前学習言語モデル、AlephBERTGimmelを紹介する。これは、以前のヘブライ語BERTモデルと比較して顕著に大きな語彙である。対照的分析を通じて、より大きな語彙はサブワードトークナイゼーションの分割を低減し、複数の自然言語処理(NLP)タスクで性能を向上させることを示している。本モデルは、語彙素性分離、品詞タグ付け、Named Entity Recognition (NER)、センチメント分析、および完全な語彙素性解析において、最先端の結果を達成している。

ABSTRACT

We present a new pre-trained language model (PLM) for modern Hebrew, termed AlephBERTGimmel, which employs a much larger vocabulary (128K items) than standard Hebrew PLMs before. We perform a contrastive analysis of this model against all previous Hebrew PLMs (mBERT, heBERT, AlephBERT) and assess the effects of larger vocabularies on task performance. Our experiments show that larger vocabularies lead to fewer splits, and that reducing splits is better for model performance, across different tasks. All in all this new model achieves new SOTA on all available Hebrew benchmarks, including Morphological Segmentation, POS Tagging, Full Morphological Analysis, NER, and Sentiment Analysis. Subsequently we advocate for PLMs that are larger not only in terms of number of layers or training data, but also in terms of their vocabulary. We release the new model publicly for unrestricted use.

研究の動機と目的

  • 事前学習言語モデルの語彙サイズが現代ヘブライ語処理に与える影響を調査すること。
  • 語彙が少ない言語、例えばヘブライ語のような低リソース言語におけるサブワードトークナイゼーションの分割問題に取り組むこと。
  • NLPタスクの正確性を向上させるために、超大規模語彙を備えた新しいヘブライ語BERTモデルを開発・評価すること。
  • 複数のタスクで既存のモデルを上回る性能を示すことで、ヘブライ語NLPの新しい最先端のベンチマークを確立すること。

提案手法

  • 標準のヘブライ語PLMと比べて顕著に大きな128,000語彙を備えた、新しいヘブライ語BERTモデル、AlephBERTGimmelを設計・訓練する。
  • 複数のNLPタスクにおいて、AlephBERTGimmelをmBERT、heBERT、AlephBERTと比較する対照的分析を実施する。
  • バイトペアエンコーディング(BPE)を用いたサブワードトークナイゼーションを実行し、語彙を最適化して未知語やサブワード分割を最小限に抑える。
  • 語彙素性分離、品詞タグ付け、NER、センチメント分析、および完全な語彙素性解析を含む、ヘブライ語NLPベンチマークの範囲でモデルをファインチューニングする。
  • 標準的な指標を用いてモデルの性能を評価し、過去の最先端モデルと比較する。
  • 今後の研究や応用を支援するため、訓練済みモデルを公開し、無制限の利用を許可する。

実験結果

リサーチクエスチョン

  • RQ1語彙サイズを拡大することで、ヘブライ語事前学習言語モデルにおけるサブワードトークナイゼーションの分割にどのような影響を与えるか?
  • RQ2より大きな語彙は、下流のヘブライ語NLPタスクにおける性能向上にどの程度寄与するか?
  • RQ3128K語彙を備えたモデルは、複数のベンチマークで既存の最先端ヘブライ語BERTモデルを上回ることができるか?
  • RQ4ヘブライ語NLPにおいて、語彙サイズの影響はモデルの深さや学習データ量の増加と比較して、どの程度顕著か?
  • RQ5サブワード分割の低減は、ヘブライ語の多様なNLPタスクにおいて一貫した性能向上をもたらすか?

主な発見

  • AlephBERTGimmelは、語彙素性分離、品詞タグ付け、完全な語彙素性解析、NER、センチメント分析を含む、すべての評価済みヘブライ語NLPベンチマークで最先端の性能を達成している。
  • より大きな語彙のおかげで、従来のモデルと比較して顕著に少ないサブワードトークナイゼーションの分割を示しており、性能向上と相関している。
  • サブワード分割の低減は、すべてのテストタスクでモデルの正確性に測定可能な向上をもたらしており、語彙サイズが低リソース言語モデルにおいて重要な要因であるという仮説を裏付けている。
  • 対照的分析により、モデルの深さや学習データ量の増加よりも、語彙サイズの拡大が性能向上に寄与していることが確認された。
  • すべてのベンチマークでmBERT、heBERT、AlephBERTを上回り、ヘブライ語NLPにおける新しい最先端の水準を確立している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。