Skip to main content
QUICK REVIEW

[論文レビュー] Improving Pre-Trained Multilingual Models with Vocabulary Expansion

Hai Wang, Dian Yu|arXiv (Cornell University)|Sep 26, 2019
Natural Language Processing Techniques参考文献 72被引用数 4
ひとこと要約

本稿では、多言語 BERT における OOV 問題を軽減するために、二語対応情報を利用した語彙拡張技術—連携マッピングとミックスチャネルマッピング—を提案しており、NER や品詞タグ付けなどのトークンレベルのタスクで顕著な性能向上を達成している。ミックスチャネルマッピングは、特に低リソース言語において連携マッピングを上回る性能を示し、多言語事前学習モデルにおけるサブワードレベル OOV 問題についての初の体系的かつ包括的な研究である。

ABSTRACT

Recently, pre-trained language models have achieved remarkable success in a broad range of natural language processing tasks. However, in multilingual setting, it is extremely resource-consuming to pre-train a deep language model over large-scale corpora for each language. Instead of exhaustively pre-training monolingual language models independently, an alternative solution is to pre-train a powerful multilingual deep language model over large-scale corpora in hundreds of languages. However, the vocabulary size for each language in such a model is relatively small, especially for low-resource languages. This limitation inevitably hinders the performance of these multilingual models on tasks such as sequence labeling, wherein in-depth token-level or sentence-level understanding is essential. In this paper, inspired by previous methods designed for monolingual settings, we investigate two approaches (i.e., joint mapping and mixture mapping) based on a pre-trained multilingual model BERT for addressing the out-of-vocabulary (OOV) problem on a variety of tasks, including part-of-speech tagging, named entity recognition, machine translation quality estimation, and machine reading comprehension. Experimental results show that using mixture mapping is more promising. To the best of our knowledge, this is the first work that attempts to address and discuss the OOV issue in multilingual settings.

研究の動機と目的

  • 多言語事前学習モデルにおける語彙外語(OOV)問題に対処すること。この問題は、トークンレベルのタスクにおける性能を制限する要因である。
  • 特に英語を中間言語(インタリンギア)として用いることで、二語対応情報が低リソース言語における OOV 語の表現を改善するかを検証すること。
  • さまざまな下流タスクにおける二つの語彙拡張手法—連携マッピングとミックスチャネルマッピング—の効果を評価すること。
  • 多言語 NLP におけるサブワードレベル OOV チャレンジについて、実証的洞察を提供すること。これは、現在までにほとんど調査が行われていない分野である。
  • 微調整時に語彙拡張を実施することで、完全な再トレーニングなしにモデル性能を顕著に向上させられることを示すこと。

提案手法

  • 100 以上の言語で共有されるトランスフォーマー構造を有する多言語 BERT をベースの事前学習モデルとして使用する。
  • 連携マッピングを適用し、同じ言語内の OOV サブワードを共有埋め込み空間を介してインベロリューション(語彙内)サブワードに一致させる。
  • ミックスチャネルマッピングを導入し、特に英語を含む複数言語の埋め込みを重み付き平均化することで、OOV サブワードを表現する。
  • ミックスチャネルマッピングでは、関連性に基づいてソース言語の埋め込みに動的重みを割り当てる学習可能なアテンション機構を採用する。
  • コストの高い再事前学習を回避するため、補助言語ペアからのサブワードトークンを微調整時に語彙に追加することで語彙拡張を実施する。
  • 英語をインタリンギアとして用い、言語間の整合性を図ることで、低リソース言語の OOV 語の表現を向上させる。

実験結果

リサーチクエスチョン

  • RQ1微調整時に語彙拡張技術を適用することで、多言語 BERT モデルにおける OOV 問題を軽減できるか?
  • RQ2特に英語をインタリンギアとして用いる二語対応情報が、低リソース言語における OOV 語の表現を改善するか?
  • RQ3さまざまな NLP タスクにおいて、連携マッピングとミックスチャネルマッピングの性能はどのように比較されるか?
  • RQ4語彙拡張の利点は、NER や POS タグ付けなどのトークンレベルタスクよりも、読解理解などの文レベルタスクで顕著に現れるか?
  • RQ5完全な多言語モデルの再トレーニングなしに、サブワードレベル OOV 問題を効果的に軽減できるか?

主な発見

  • ミックスチャネルマッピングは、すべての評価タスクで連携マッピングを上回る優れた性能を示し、特に低リソース環境下で顕著である。
  • 品詞タグ付けタスクでは、スワヒリ語 や タイ語 などの低リソース言語において、OOV エラー率が最大 30% 減少した。
  • 命名エンティティ認識(NER)では、最大 4.2 ポints の F1 スコア向上が、ミックスチャネルマッピングを用いることで達成された。
  • 機械翻訳の品質推定タスクでは、複数の言語ペアにおいてスピアマンの rho が 0.05~0.10 まで向上し、顕著な改善が見られた。
  • 文レベルタスク、特に機械的読解理解では OOV 問題の影響が小さいことが判明し、性能向上も小さいことが一致していた。
  • 本研究では、微調整時に語彙拡張を実施することが有効かつスケーラブルであることが確認された。これは、完全な再トレーニングの計算コストを回避する手段として有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。