Skip to main content
QUICK REVIEW

[論文レビュー] HerBERT: Efficiently Pretrained Transformer-based Language Model for Polish

Robert Mroczkowski, Piotr Rybak|arXiv (Cornell University)|May 4, 2021
Topic Modeling参考文献 36被引用数 32
ひとこと要約

本論文は、多言語モデルからモノ言語Polish BERTへ知識を転移する効率的な事前学習手法を設計し、体系的なアブレーションを行い、Polish言語理解ベンチマーク(KLEJおよび品詞タグ付け)で最先端の結果を達成するHerBERTを公開する。

ABSTRACT

BERT-based models are currently used for solving nearly all Natural Language Processing (NLP) tasks and most often achieve state-of-the-art results. Therefore, the NLP community conducts extensive research on understanding these models, but above all on designing effective and efficient training procedures. Several ablation studies investigating how to train BERT-like models have been carried out, but the vast majority of them concerned only the English language. A training procedure designed for English does not have to be universal and applicable to other especially typologically different languages. Therefore, this paper presents the first ablation study focused on Polish, which, unlike the isolating English language, is a fusional language. We design and thoroughly evaluate a pretraining procedure of transferring knowledge from multilingual to monolingual BERT-based models. In addition to multilingual model initialization, other factors that possibly influence pretraining are also explored, i.e. training objective, corpus size, BPE-Dropout, and pretraining length. Based on the proposed procedure, a Polish BERT-based language model -- HerBERT -- is trained. This model achieves state-of-the-art results on multiple downstream tasks.

研究の動機と目的

  • 英語中心の研究を超えたポーランド語理解のための効率的な事前学習を動機づけ、評価する。
  • 初期化、コーパスサイズ、学習目的、BPE-Dropout、事前学習長さなど、ポーランド語の事前学習性能に影響を与える要因を体系的に研究する。
  • 多言語知識をモノ言語のポーランド語モデルへ転移する実用的な手順を開発し、事前学習済みモデルを公開する。
  • 提案手順が多様なポーランド語NLPタスクで最先端の結果をもたらすことを示す。

提案手法

  • 語彙ベースのマスキング向上を含む更新されたMLM目的を使用する(サブワード意識のマスキング)。
  • Next Sentence PredictionをSentence Structural Objective (SSO)に置き換え、その影響を評価する。
  • ポーランド語モデルを多言語XLM-RoBERTaの重みから初期化し、代わりにランダムにも初期化して、転移の有効性を比較する。
  • BASEとLARGEのバリアントを2つのポーランド語コーパスで訓練する(Small: NKJP, Wikipedia, Wolne Lektury; Large: Small plus CCNet and Open Subtitles)。
  • 初期化、コーパスサイズ、SSO重み、BPE-Dropout、事前学習長さを変えた広範なアブレーション研究を実施し、KLEJ、品詞タグ付け、依存構造解析で評価する。

実験結果

リサーチクエスチョン

  • RQ1多言語モデル(例:XLM-RoBERTa)からの初期化は、ランダム初期化と比較して、ポーランド語モノリンガルモデルの迅速な収束と最終性能を改善するか?
  • RQ2コーパスサイズ、学習目的(MLM + SSO)、およびBPE-Dropoutは、下流のポーランド語NLPタスクの性能にどう影響するか?
  • RQ3Sentence Structural Objective (SSO) はポーランド語に有益か、そして事前学習長さは性能にどう影響するか?

主な発見

  • 多言語初期化されたHerBERT(BASEおよびLARGE)は、ランダム初期化された対になるモデルおよび Polish RoBERTa を平均して上回り、初期化が最も重要な要因である。
  • より大きなコーパスでの訓練は一般に下流の性能を改善し、いくつかの設定で統計的に有意な向上をもたらす。
  • SSOは、英語中心の研究とは対照的に、ポーランド語の下流性能を一般に悪化させる;最良の結果は低いまたはゼロ近いSSO重みでしばしば得られる。
  • BPE-Dropoutは、報告された設定ではポーランド語に対して一貫した有意な利得や損失を示さない。
  • HerBERT LARGEはKLEJベンチマークで平均性能が最も高く、ポーランド語理解の新しい最先端となる;HerBERT BASEも平均性能でPolish RoBERTaを上回る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。