Skip to main content
QUICK REVIEW

[論文レビュー] PKUSEG: A Toolkit for Multi-Domain Chinese Word Segmentation

Ruixuan Luo, Jingjing Xu|arXiv (Cornell University)|Jun 27, 2019
Natural Language Processing Techniques参考文献 10被引用数 108
ひとこと要約

PKUSEG は、ドメイン特化モデル、教師なしドメイン適応、品詞タグ付けを備えた多ドメイン中国語単語分割ツールキットを提供し、初期性能を高く保ちつつ、転移学習を容易にします。

ABSTRACT

Chinese word segmentation (CWS) is a fundamental step of Chinese natural language processing. In this paper, we build a new toolkit, named PKUSEG, for multi-domain word segmentation. Unlike existing single-model toolkits, PKUSEG targets multi-domain word segmentation and provides separate models for different domains, such as web, medicine, and tourism. Besides, due to the lack of labeled data in many domains, we propose a domain adaptation paradigm to introduce cross-domain semantic knowledge via a translation system. Through this method, we generate synthetic data using a large amount of unlabeled data in the target domain and then obtain a word segmentation model for the target domain. We also further refine the performance of the default model with the help of synthetic data. Experiments show that PKUSEG achieves high performance on multiple domains. The new toolkit also supports POS tagging and model training to adapt to various application scenarios. The toolkit is now freely and publicly available for the usage of research and industry.

研究の動機と目的

  • ニュース、ウェブ、医療、観光など、多様なドメインにわたる堅牢な中国語単語分割を実現すること。
  • ドメイン特化の事前学習済みモデルとコース-から-ファインの微調整戦略を提供する。
  • ターゲットドメインのラベルなしデータを活用する教師なしドメイン適応を導入する。
  • 品詞タグ付けとユーザーが訓練したモデルを有効にし、さまざまな下流タスクをサポートする。

提案手法

  • セグメンテーションには、Viterbi 推論を用いた高速かつ高精度のCRFモデルを使用。
  • 高次元CRF特徴を効率的に学習するために、適応オンライン勾配降下法(ADF)を適用。
  • ニュースとウェブを含む混合ドメインデータ(CTBを含む)で粗粒度モデルを事前学習し、ドメインデータで微調整。
  • 翻訳とトランスフォーマーを用いて合成データを得るためのマスク付きアテンション拡張(mA^2)を導入し、教師なしドメイン適応を可能にする。
  • 複数のソースから約85万語の大規模ドメイン語彙を構築し、カバレッジを向上。
  • ドメイン特化および粗粒度のセグメンテーション用ツールと、ユーザー定義辞書および新モデルの訓練を提供。

実験結果

リサーチクエスチョン

  • RQ1PKUSEG は、ドメイン特化モデルを用いて複数のドメインで高い分割精度を達成できるか?
  • RQ2混合ドメインデータでの事前学習は、ドメイン特定ターゲットの性能を向上させるか?
  • RQ3教師なしドメイン適応(mA^2)は、ラベルなしリソースから有用なターゲットドメインデータを生成できるか?
  • RQ4ドメイン特化モデルと比較して、精練されたデフォルトモデルはアウトオブドメインデータにどのように一般化するか?

主な発見

  • ドメイン特化モデルは、すべての評価ドメインでデフォルトモデルを上回る。
  • 事前学習+微調整により、医薬、ウェブ、ニュース、観光の平均F1が向上。
  • 教師なしドメイン適応(mA^2)は、ラベル付きデータが乏しい場合にドメイン性能をデフォルトより改善(Science, Art, Entertainmentで平均利得を観察)。
  • 合成データでデフォルトモデルを洗練すると、アウトオブドメインデータセットでF1が+0.67向上し、ドメイン内性能を損なわない。
  • 大規模ドメイン語彙は、ドメイン特有用語のカバレッジを大幅に向上(総計約85万語)。
  • 分割と同時に品詞タグ付けをサポートし、適用範囲を広げる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。