[論文レビュー] AMBERT: A Pre-trained Language Model with Multi-Grained Tokenization
AMBERTは、共有パラメータエンコーダーを用いて、細粒度(語/サブワード)と粗粒度(フレーズ/語)の両方のトークンの文脈的表現を同時に学習する、マルチグレインなBERTモデルを提案する。中国語のCLUEベンチマークでは平均で2.7%、複数の英語ベンチマークでは3.0%以上、BERTを上回る性能を発揮し、1つのエンコーダーのみを用いる効率的な推論バージョンも提供する。
Pre-trained language models such as BERT have exhibited remarkable performances in many tasks in natural language understanding (NLU). The tokens in the models are usually fine-grained in the sense that for languages like English they are words or sub-words and for languages like Chinese they are characters. In English, for example, there are multi-word expressions which form natural lexical units and thus the use of coarse-grained tokenization also appears to be reasonable. In fact, both fine-grained and coarse-grained tokenizations have advantages and disadvantages for learning of pre-trained language models. In this paper, we propose a novel pre-trained language model, referred to as AMBERT (A Multi-grained BERT), on the basis of both fine-grained and coarse-grained tokenizations. For English, AMBERT takes both the sequence of words (fine-grained tokens) and the sequence of phrases (coarse-grained tokens) as input after tokenization, employs one encoder for processing the sequence of words and the other encoder for processing the sequence of the phrases, utilizes shared parameters between the two encoders, and finally creates a sequence of contextualized representations of the words and a sequence of contextualized representations of the phrases. Experiments have been conducted on benchmark datasets for Chinese and English, including CLUE, GLUE, SQuAD and RACE. The results show that AMBERT can outperform BERT in all cases, particularly the improvements are significant for Chinese. We also develop a method to improve the efficiency of AMBERT in inference, which still performs better than BERT with the same computational cost as BERT.
研究の動機と目的
- 事前学習言語モデルにおける単一グレイントークン化の限界を解消するため、細粒度と粗粒度の表現を統合すること。
- 語レベルとフレーズレベルの表現を同時に学習することで、NLUタスクにおけるモデル性能が向上するかどうかを調査すること。
- 選択的なエンコーダー使用により、推論時の計算コストを低減しながら性能を維持すること。
- 中国語と英語におけるトークン化比の違いにより、マルチグレインモデリングが中国語でより大きな向上をもたらす理由を分析すること。
提案手法
- AMBERTは、細粒度トークン(英語では語/サブワード、中国語では文字)用と粗粒度トークン(英語ではフレーズ、中国語では語)用の2つの並列エンコーダーを採用する。
- 2つのエンコーダーはパラメータを共有しており、追加のパラメータ数を最小限に抑えつつ、マルチグレイン表現の共同学習を可能にする。
- 入力テキストは両方のレベルでトークン化される:英語では語レベルとフレーズレベル(フレーズトークナイザーを用いて)、中国語では文字レベルと語レベル。
- 各位置に対して、語レベルとフレーズレベルの両方のトークンの文脈的表現が生成され、意味的豊かさが向上する。
- 開発セットでの性能に基づき、推論時に細粒度または粗粒度の1つのエンコーダーのみを選択する最適化手法が導入されている。
- 事前学習段階ではマスク言語モデリング(MLM)が用いられ、エンコーダー間で注意メカニズムを共有することで表現の整合性を保っている。
実験結果
リサーチクエスチョン
- RQ1複数のグレインレベルでの表現を同時に学習することで、事前学習言語モデルの性能が向上するか?
- RQ2なぜマルチグレインモデリングは中国語では英語よりも大きな向上をもたらすのか?
- RQ3細粒度と粗粒度エンコーダー間のパラメータ共有が、表現の整合性とモデル性能に与える影響は何か?
- RQ4計算コストを半減させながらも高い性能を維持できる、効率的な推論モードを設計できるか?
- RQ5マルチグレイン表現における注意パターンは、単一グレインモデルと比較して、どのような影響を及ぼすか?
主な発見
- 英語ベンチマークでは、GLUEで2.0%、RACEで2.5%、SQuADで5.1%、BERTを上回った。
- 中国語では、Google BERTと比較してCLUEの平均スコアを2.7%以上向上させた。
- AMBERTとAMBERT-Comboの性能差は、グレイン間の表現を整合させるパラメータ共有に起因する。
- 推論時、1つのエンコーダーのみを用いても、同等の計算コストでの単一グレインBERTモデルを上回る性能を維持した。
- AMBERTの注意パターンは、語同士やフレーズ同士の内部注意(イントラレベル注意)を保持しているが、AMBERT-Hybridとは異なり、細粒度注意が弱体化しない。
- 中国語でより大きな向上が得られる理由は、粗粒度トークンの割合が英語(13.1%)よりも高い(51.5%)ため、マルチグレイン学習の効果が顕著に現れるからである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。