Skip to main content
QUICK REVIEW

[論文レビュー] BERT Meets Chinese Word Segmentation

Haiqin Yang|arXiv (Cornell University)|Sep 20, 2019
Topic Modeling参考文献 20被引用数 12
ひとこと要約

本稿では、BERTを中国語語彙分割(CWS)に応用する応用を調査し、ベースラインモデルと比較して、MSRではF1スコアが+0.3、PKUでは+0.4向上することを示している。BERTの文脈特徴はラベル不一致に対しても頑健であることが示され、計算コストが著しく低いにもかかわらず、Softmaxのような単純な分類器がCRFと同等の性能を発揮することが分かった。

ABSTRACT

Chinese word segmentation (CWS) is a fundamental task for Chinese language understanding. Recently, neural network-based models have attained superior performance in solving the in-domain CWS task. Last year, Bidirectional Encoder Representation from Transformers (BERT), a new language representation model, has been proposed as a backbone model for many natural language tasks and redefined the corresponding performance. The excellent performance of BERT motivates us to apply it to solve the CWS task. By conducting intensive experiments in the benchmark datasets from the second International Chinese Word Segmentation Bake-off, we obtain several keen observations. BERT can slightly improve the performance even when the datasets contain the issue of labeling inconsistency. When applying sufficiently learned features, Softmax, a simpler classifier, can attain the same performance as that of a more complicated classifier, e.g., Conditional Random Field (CRF). The performance of BERT usually increases as the model size increases. The features extracted by BERT can be also applied as good candidates for other neural network models.

研究の動機と目的

  • BERTが中国語語彙分割(CWS)という基本的NLPタスクの性能向上に寄与するかどうかを評価すること。
  • BERT特徴を用いる際の文字レベル表現とさまざまな分類器(例:Softmax対CRF)のトレードオフを調査すること。
  • BERTモデルサイズがCWS性能に与える影響を分析すること。
  • BERTから抽出した特徴が、他のニューラルCWSモデルに有効なELMo風の表現として機能するかどうかを評価すること。
  • 熟語表現に対するBERTの予測を用いて、ベンチマークデータセットにおけるラベル不一致を同定・分析すること。

提案手法

  • MSRおよびPKUのドメイン特化CWSデータセット上でBERTを微調整し、文脈的トークン表現を抽出する。
  • BERTの最終隠れ状態を、従来の文字埋め込みの代わりに、下流のCWS分類器の入力特徴として使用する。
  • BERT埋め込み特徴を用いた際のSoftmaxと条件付きランダムフィールド(CRF)の分類器性能を比較する。
  • モデル容量の影響を評価するため、さまざまなサイズ(base、large)のBERTモデルを訓練・評価する。
  • 他のニューラルCWSアーキテクチャにBERT特徴を事前学習済み文脈表現として適用し、その転送可能性をテストする。
  • 熟語表現における予測誤差を分析し、トレーニングデータおよびテストデータのアノテーションに不一致がないかを検出する。

実験結果

リサーチクエスチョン

  • RQ1ラベル不一致がトレーニングデータに存在する場合でも、BERTが中国語語彙分割タスクの性能向上に寄与できるか?
  • RQ2BERT特徴と組み合わせた際、SoftmaxとCRFを分類器として用いる際のトレードオフは何か?
  • RQ3BERTモデルサイズがCWSベンチマークでの分割性能に与える影響はいかほどか?
  • RQ4BERT特徴は、ELMoと同様に、他のニューラルCWSモデルにおいて有効な文脈表現として再利用可能か?
  • RQ5BERTの予測結果は、熟語表現(特に「银装素裹」や「至关重要」など)に関して、ベンチマークデータセットのアノテーションに不一致が存在するかどうかをどの程度明らかにできるか?

主な発見

  • Softmaxを分類器として用いた場合、MSRデータセットではF1スコアが+0.3、PKUデータセットでは+0.4向上する。
  • 十分に学習されたBERT特徴と組み合わせた場合、SoftmaxはCRFと同等の性能を達成するが、推論時間が著しく短くなる。
  • 大きなBERTモデルは一貫して優れたCWS性能を示し、モデルサイズと分割精度の間には正の相関があることが示された。
  • BERTから抽出した特徴は有効な文脈表現として機能し、他のニューラルCWSモデルへの再利用に成功しており、転送性が確認された。
  • BERTの予測結果は、特に「银装素裹」や「至关重要」のような熟語表現において、トレーニングデータとテストデータの語区切りに不一致があることを明らかにした。
  • モデルはOOV(語彙外)トークンや多言語文に対して苦労しており、珍しい文字や混合スクリプト入力の処理に限界があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。