Skip to main content
QUICK REVIEW

[論文レビュー] Does Higher Order LSTM Have Better Accuracy for Segmenting and Labeling Sequence Data?

Yi Zhang, Xu Sun|arXiv (Cornell University)|Nov 22, 2017
Topic Modeling参考文献 31被引用数 5
ひとこと要約

本稿では、スケーラビリティを維持するために刈り込み技術を用いて低次元および高次元のタグ依存関係を統合する、新しい順序系列分類モデルであるMulti-Order BiLSTM (MO-BiLSTM) を提案する。標準のLSTM-CRFモデルが隣接タグ遷移のみをモデル化するのに対し、MO-BiLSTMは複数の順序状態からの予測を組み合わせることで、より長い距離のタグ依存関係を捉えることができ、すべてのフレーズチャンキングタスクで最先端のF1スコアを達成し、Named Entity Recognitionタスクでも競争力のある結果を示した。

ABSTRACT

Existing neural models usually predict the tag of the current token independent of the neighboring tags. The popular LSTM-CRF model considers the tag dependencies between every two consecutive tags. However, it is hard for existing neural models to take longer distance dependencies of tags into consideration. The scalability is mainly limited by the complex model structures and the cost of dynamic programming during training. In our work, we first design a new model called "high order LSTM" to predict multiple tags for the current token which contains not only the current tag but also the previous several tags. We call the number of tags in one prediction as "order". Then we propose a new method called Multi-Order BiLSTM (MO-BiLSTM) which combines low order and high order LSTMs together. MO-BiLSTM keeps the scalability to high order models with a pruning technique. We evaluate MO-BiLSTM on all-phrase chunking and NER datasets. Experiment results show that MO-BiLSTM achieves the state-of-the-art result in chunking and highly competitive results in two NER datasets.

研究の動機と目的

  • 順序系列分類タスクにおける従来のニューラルモデルが長距離のタグ依存関係を捉えることの制限を解決すること。
  • 複数のタグを同時に予測する高次元LSTMモデルが、順序分離および分類の精度を向上させるかを調査すること。
  • 純粋な高次元LSTMモデルのスケーラビリティおよび性能低下の問題を、ハイブリッドアーキテクチャによって克服すること。
  • 複数の順序のタグ情報を統合しつつ、学習および推論の効率を維持するための刈り込みベースの手法を開発すること。
  • 境界や長距離セグメントの認識において、隣接ペアを越えたタグ依存関係をモデル化することの有効性を示すこと。

提案手法

  • 各予測が現在のトークンと直前の(n-1)個のタグを含む単一順序LSTMモデルを設計し、これにより「順序-n」のラベル系列が形成される。
  • 「順序」とは、予測に関与する連続するタグの数を指し、順序-1はユニグラム、順序-2はビグラムなどとなる。
  • 複数の順序モデル(例:順序-1 と 順序-2)からの予測を統合する統一されたデコードフレームワークを備えた、Multi-Order BiLSTM (MO-BiLSTM) を提案する。
  • 高次元モデルの計算コストを性能を損なわせることなく削減するために、学習中に刈り込み技術を適用する。
  • Bi-LSTMエンコーダーとソフトマックス出力層を用いて、各順序のタグスコアを計算し、エンド・ツー・エンドの学習を可能にする。
  • 構造的予測メカニズムを用いて、異なる順序間の依存関係を活用することで、デコード段階で複数の順序の予測を統合する。

実験結果

リサーチクエスチョン

  • RQ1LSTMモデルの順序を増やす(すなわち、より多くの過去のタグをモデル化する)ことで、チャンキングおよびNERタスクにおける順序系列分類の精度が向上するか?
  • RQ2純粋な高次元LSTMモデルは、タグ依存関係をより多く捉えられるにもかかわらず、順序が増加するにつれて性能が劣化する理由は何か?
  • RQ3刈り込み技術を用いて低次元および高次元モデルを統合することで、スケーラビリティを保ちつつ性能を向上させられるか?
  • RQ4標準のBiLSTMモデルと比較して、提案されたMO-BiLSTMは境界レベルの誤りをどの程度低減するか?
  • RQ5長距離依存関係が重要な長距離セグメント認識において、モデルの性能はいかがであるか?

主な発見

  • 純粋な単一順序LSTMモデルは、理論的にはより長い依存関係をモデル化できるものの、順序が増加するにつれて性能が劣化することが判明した。
  • MO-BiLSTMは、CoNLL-2000チャンキングデータセットで97.42の最先端F1スコアを達成し、既存手法を上回った。
  • 標準のBiLSTMと比較して、境界認識誤りを約40%削減し、特に長距離セグメント検出における改善が顕著であった。
  • 長さ5トークン以上のエンティティでは、誤り率がBiLSTMの27.42%からMO-BiLSTMの14.52%に低下し、強力な長距離依存関係学習能力を示した。
  • 刈り込み技術により、MO-BiLSTMはトレーニング中に動的計画法を必要とせず、高次元モデルへのスケーリングを効率的に行えるようになった。
  • 境界誤りタイプ(boundary-1, boundary-2, boundary-3)において顕著な改善が見られ、セグメント境界検出能力の向上が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。