Skip to main content
QUICK REVIEW

[論文レビュー] Chinese Word Segmentation with Heterogeneous Graph Neural Network

Xuemei Tang, Jun Wang|arXiv (Cornell University)|Jan 22, 2022
Natural Language Processing Techniques被引用数 5
ひとこと要約

本稿では、文字、語、n-gram、依存構文といった多レベルの言語的特徴を統合するための非均質的グラフニューラルネットワークフレームワークHGNSegを提案する。このフレームワークは、統一されたグラフ構造に多様な言語的特徴を統合することで、中国語語彙分割(CWS)の性能を向上させる。事前学習済み言語モデルを活用し、外部知識を非均質的グラフ学習で構造化することで、6つのベンチマークデータセットで最先端の性能を達成し、特にクロスドメイン設定においてOOV(語彙外語)エラーを顕著に低減する。

ABSTRACT

In recent years, deep learning has achieved significant success in the Chinese word segmentation (CWS) task. Most of these methods improve the performance of CWS by leveraging external information, e.g., words, sub-words, syntax. However, existing approaches fail to effectively integrate the multi-level linguistic information and also ignore the structural feature of the external information. Therefore, in this paper, we proposed a framework to improve CWS, named HGNSeg. It exploits multi-level external information sufficiently with the pre-trained language model and heterogeneous graph neural network. The experimental results on six benchmark datasets (e.g., Bakeoff 2005, Bakeoff 2008) validate that our approach can effectively improve the performance of Chinese word segmentation. Importantly, in cross-domain scenarios, our method also shows a strong ability to alleviate the out-of-vocabulary (OOV) problem.

研究の動機と目的

  • 既存のCWS手法が多レベルの言語的情報と構造的依存関係を効果的に統合できないという限界を解決すること。
  • 文字、語、n-gram、依存構文をグラフ内の非均質的ノードとしてモデル化することで、中国語語彙分割の性能を向上させること。
  • 豊富な言語的表現を用いることで、クロスドメインCWSシナリオにおける語彙外語(OOV)問題を軽減すること。
  • 外部言語リソースからの構造的情報をグラフニューラルネットワークを用いて明示的に符号化する新しいフレームワークの開発

提案手法

  • ノードが文字、分割済み語、n-gram、文法的依存関係を表す非均質的グラフを構築し、各言語的レベルに固有のノードタイプを設定する。
  • 複数のエッジタイプを設定:位置的整合性に基づく文字-語/n-gramエッジ、および解析ツールから得た主語-目的語関係に基づく依存構文エッジ。
  • 非均質的グラフニューラルネットワーク(HGNN)を用い、異なるノードタイプとエッジタイプ間で近隣情報の集約を実行し、メッセージパッシングによりノード表現を更新する。
  • 文脈表現を強化するため、事前学習済み言語モデルの埋め込みを初期ノード特徴として統合する。
  • CWSのシーケンスラベルリング損失を共同で最適化し、F1スコアとOOVリCALLを最適化するようにモデルを学習する。
  • 6つのベンチマークデータセット(例:Bakeoff 2005, 2008)でモデルを評価し、各グラフサブグラフの寄与度を分析するために構成要因をアブレーションする。

実験結果

リサーチクエスチョン

  • RQ1非均質的グラフニューラルネットワークは、文字、語、n-gram、構文といった多レベルの言語的特徴を中国語語彙分割に効果的に統合できるか?
  • RQ2表面的特徴のみを用いるモデルと比較して、依存構文構造の組み込みが、分割精度とOOV処理の両面でどのように向上をもたらすか?
  • RQ3提案フレームワークは、クロスドメインCWSシナリオにおいて、語彙外語(OOV)エラー率をどの程度低減できるか?
  • RQ4学習セットベースの語彙と高頻度n-gram語彙、LTP 4.0とStanford CoreNLPといった異なる語彙解析ツールが、モデル性能にどのように影響を与えるか?

主な発見

  • HGNSegは6つのベンチマークCWSデータセットで最先端の性能を達成し、F1スコアが常に先行手法を上回る。
  • 文字-語/n-gramサブグラフが最も顕著な寄与を示し、PKUでは最大3%、MSRでは1.62%のF1スコア向上をもたらした。
  • 依存構文サブグラフはF1スコアとOOVリCALLの両方を向上させるが、文字-語/n-gramサブグラフほど顕著な影響ではない。
  • クロスドメイン設定では、ドメイン固有のn-gramを活用することでOOVエラーが低減され、データセット平均で$R_{oov}$が78.80%から80.67%に上昇した。
  • LTP 4.0は本フレームワークにおいてStanford CoreNLPを上回り、全データセットでより高いCWS F1スコアを達成した。
  • 学習セットベース語彙と高頻度n-gram語彙を組み合わせることで最良の性能が得られ、SXUでは$R_{oov}$が86.10%、CITYUでは91.99%に達した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。