Skip to main content
QUICK REVIEW

[論文レビュー] Bertinho: Galician BERT Representations

David Vilares, Marcos García|arXiv (Cornell University)|Mar 25, 2021
Basque language and culture studies参考文献 49被引用数 10
ひとこと要約

この論文では、1枚のGPUで単一のGPUで4500万トークン未塔のGalicianコーパスを用いて微調整された、単語言語Bertinhoというモデルを紹介する。限られたデータにもかかわらず、12層のBertinho baseモデルはPOSタギング、依存解析、固有表現抽出のすべてのタスクで多言語Bert(mBERT)を上回り、6層バージョンも大多数のタスクでmBERTを上回る。

ABSTRACT

This paper presents a monolingual BERT model for Galician. We follow the recent trend that shows that it is feasible to build robust monolingual BERT models even for relatively low-resource languages, while performing better than the well-known official multilingual BERT (mBERT). More particularly, we release two monolingual Galician BERT models, built using 6 and 12 transformer layers, respectively; trained with limited resources (~45 million tokens on a single GPU of 24GB). We then provide an exhaustive evaluation on a number of tasks such as POS-tagging, dependency parsing and named entity recognition. For this purpose, all these tasks are cast in a pure sequence labeling setup in order to run BERT without the need to include any additional layers on top of it (we only use an output classification layer to map the contextualized representations into the predicted label). The experiments show that our models, especially the 12-layer one, outperform the results of mBERT in most tasks.

研究の動機と目的

  • Galicianというコンテキスト付き埋め込みが不足している低リソース言語向けに、単語言語Bertモデルを開発すること。
  • データ制約下でのモデル深さ(6層対12層)が性能に与える影響を評価すること。
  • 下流NLPタスクにおける単語言語Galician BERT(Bertinho)と多言語Bert(mBERT)を比較すること。
  • 低リソース言語向けに二段階の事前学習戦略の有効性を調査すること。
  • NLPコミュニティに自由に利用可能な高パフォーマンスなGalician BERTモデルをリリースすること。

提案手法

  • 4500万トークン未塔の単語言語Galicianコーパス上で6層および12層のBERTモデルを事前学習した。
  • 訓練には1枚のTESLA P40 GPUを用い、標準的なBERTの目的関数(マスク言語モデルと次文予測)を適用した。
  • Galician語の語彙的分割を改善するために、カスタムトークナイザーを設計した。
  • 標準データセットを用いてPOSタギング、依存解析、固有表現抽出(NER)の評価を実施した。
  • すべてのタスクで公式の多言語Bert(mBERT)モデルと性能を比較した。
  • 限られたハードウェア制約にもかかわらず、短いシーケンスでの初期事前学習と、その後の長いシーケンスでのファインチューニングという二段階の訓練戦略を検討した。

実験結果

リサーチクエスチョン

  • RQ1限られたGalicianデータで学習した単語言語BERTモデルが、下流NLPタスクでmBERTを上回ることができるか?
  • RQ2データが乏しい状況下で、モデル深さ(6層対12層)が性能に与える影響は何か?
  • RQ3二段階の事前学習戦略が、Galicianのような低リソース言語のモデル性能を向上させるか?
  • RQ4カスタムトークナイザーは、Galician BERTモデルにおける語彙的表現の向上にどの程度寄与するか?
  • RQ5mBERTは他のタスクで単語言語モデルを下回っているにもかかわらず、なぜNERでは優れているのか?

主な発見

  • 12層のBertinho baseモデルは、POSタギング、依存解析、NERを含むすべての下流タスクでmBERTを上回った。
  • 6層のBertinho smallモデルも大多数のタスクでmBERTを上回り、計算コストを低減しつつも強力なパフォーマンスを示した。
  • mBERTはNERタスクでBertinhoを上回ったが、特に複雑な名前や共通名詞ベースの組織名の処理において顕著だった。一部の誤りは、正解ラベルの誤りに起因するとされた。
  • 二段階の訓練戦略は性能を低下させた可能性が高く、ハードウェア制限による第二段階での小バッチサイズが原因と考えられた。
  • カスタムトークナイザーは、特に変形したGalician語の語彙的分割を改善した。
  • BETOのような関連言語のモデルよりも少ない4500万トークン未塔を使用したにもかかわらず、BertinhoはGalician NLPの最先端の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。