Skip to main content
QUICK REVIEW

[論文レビュー] Mono vs Multilingual Transformer-based Models: a Comparison across Several Language Tasks

Diego de Vargas Feijó, Viviane P. Moreira|arXiv (Cornell University)|Jul 19, 2020
Topic Modeling参考文献 17被引用数 7
ひとこと要約

本稿では、多言語対応BertPTおよびAlbertPTを、多様なポルトガル語コーパス上で事前学習した単言語BertおよびAlbertモデルを紹介し、7つの自然言語処理(NLP)タスクにおいて多言語Bertとの性能を比較する。結果として、単言語モデルは大多数のタスクで最先端の性能を達成しており、多言語Bertと5%以内の差にとどまることが示された。これは、ポルトガル語向けに単一言語モデルを訓練する利点が限定的であることを示唆している。

ABSTRACT

BERT (Bidirectional Encoder Representations from Transformers) and ALBERT (A Lite BERT) are methods for pre-training language models which can later be fine-tuned for a variety of Natural Language Understanding tasks. These methods have been applied to a number of such tasks (mostly in English), achieving results that outperform the state-of-the-art. In this paper, our contribution is twofold. First, we make available our trained BERT and Albert model for Portuguese. Second, we compare our monolingual and the standard multilingual models using experiments in semantic textual similarity, recognizing textual entailment, textual category classification, sentiment analysis, offensive comment detection, and fake news detection, to assess the effectiveness of the generated language representations. The results suggest that both monolingual and multilingual models are able to achieve state-of-the-art and the advantage of training a single language model, if any, is small.

研究の動機と目的

  • 多言語NLPリソースにおけるポルトガル語の不足を補うために、単言語BertおよびAlbertモデルを訓練・公開すること。
  • 単一言語NLPタスクにおいて、単言語ポルトガル語モデルが多言語モデルを上回るかを評価すること。
  • ポルトガル語の多様なNLPタスクにおいて、単言語(BertPT, AlbertPT)と多言語Bertの有効性を比較すること。
  • 研究者に、複雑なトレーニングパイプラインを必要としない、自由に利用可能な高品質なポルトガル語NLP用事前学習モデルを提供すること。

提案手法

  • Wikipedia、ニュース、字幕、研究要約、議会会議録など、多様なポルトガル語テキストソースを用いて、BertPTおよびAlbertPTを事前学習。
  • マスク言語モデルと次文予測の事前学習目的を用いた、標準的なBertおよびAlbertアーキテクチャを採用。
  • 文書の意味的類似度、テキスト帰属関係、テキスト分類、感情分析、攻撃的コメント検出、フェイクニュース検出、感情分類の7つの下流NLPタスクで微調整。
  • 10分割交差検証を用い、標準的な指標(正解率、F1スコア、マクロ/ミクロ平均)を用いて性能を評価。
  • 公表済みのベースラインおよび公式の多言語Bertモデルと比較し、性能差が5%以内であれば同等とみなした。
  • 感情分類には、多クラスおよび二値分類の両方の設定を適用し、6つの感情クラスにおけるF1スコアおよび正解率の平均値を用いた。

実験結果

リサーチクエスチョン

  • RQ1ポルトガル語で微調整された単言語Bertモデルは、ポルトガル語NLPタスクにおいて多言語Bertモデルを上回る性能を示すか?
  • RQ2BertPTおよびAlbertPTの性能は、複数のNLPタスクにおける既存のタスク特化ベースラインと比較してどうか?
  • RQ3多様なポルトガル語テキストドメインで学習することで、多言語モデルと比較してモデルの一般化性能がどの程度向上するか?
  • RQ4単言語モデルと多言語モデルの性能差が、ポルトガル語向けに専用の単言語モデルを訓練することを正当化するほど有意義か?
  • RQ5モデルサイズや学習効率(例:ALBERT対Bert)は、ポルトガル語の低リソースNLPタスクにおける性能にどのように影響するか?

主な発見

  • BertPTおよびAlbertPTは、評価された7つのNLPタスクの多くで既存のベースラインを上回り、ポルトガル語向けに強力な性能を示した。
  • BertPT/AlbertPTと多言語Bertとの性能差は、38回のペアワイズ比較のうち32回で5%以内にとどまり、同等の有効性を示した。
  • AlbertPTは38回の比較のうち28回でBertPTと同等または優れた性能を示し、6勝4敗の成績を残した。加えて、トレーニングコストが低く、より好ましい選択肢となった。
  • 多言語Bertは、BertPT(12勝)およびAlbertPT(13勝)よりも13勝と多く、スペイン語などの類似言語にさらされた影響によりわずかに優位性を示した可能性がある。
  • 特に、攻撃的コメント検出や感情分析といった非公式なテキストタスクでは、多言語Bertがそのスタイルのトレーニングを受けていなかったため性能が低く、本モデルはその点で顕著に優れた性能を示した。
  • 感情分類における誤分類は、主にデータセットのアノテーションの不整合に起因しており、モデルの限界ではなく、F1スコア0.84の強力なベースラインと同等またはわずかに下回る性能を示したにもかかわらず、多クラス設定での正解率が低かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。