Skip to main content
QUICK REVIEW

[論文レビュー] Discontinuous Named Entity Recognition as Maximal Clique Discovery

Yucheng Wang, Bowen Yu|arXiv (Cornell University)|Jun 1, 2021
Topic Modeling参考文献 32被引用数 4
ひとこと要約

この論文では、マクロな名前付きエンティティ抽出(NER)モデルであるMacを提案する。Macは、断片的NERを、ノードが候補スパンを表し、同じエンティティに属するスパン同士を結ぶエッジを持つセグメントグラフ内での最大クリーク探索問題として定式化する。2次元グリッドタギング方式を用いて1段階でスパン抽出とエッジ予測を同時に学習することで、露出バイアスを解消し、従来手法に比べて最大3.5 F1ポイントの向上と5倍の推論速度向上を達成した。

ABSTRACT

Named entity recognition (NER) remains challenging when entity mentions can be discontinuous. Existing methods break the recognition process into several sequential steps. In training, they predict conditioned on the golden intermediate results, while at inference relying on the model output of the previous steps, which introduces exposure bias. To solve this problem, we first construct a segment graph for each sentence, in which each node denotes a segment (a continuous entity on its own, or a part of discontinuous entities), and an edge links two nodes that belong to the same entity. The nodes and edges can be generated respectively in one stage with a grid tagging scheme and learned jointly using a novel architecture named Mac. Then discontinuous NER can be reformulated as a non-parametric process of discovering maximal cliques in the graph and concatenating the spans in each clique. Experiments on three benchmarks show that our method outperforms the state-of-the-art (SOTA) results, with up to 3.5 percentage points improvement on F1, and achieves 5x speedup over the SOTA model.

研究の動機と目的

  • 従来の断片的NERモデルが逐次的で多段階の予測パイプラインに依存するため生じる露出バイアスを解消すること。
  • 臨床的・複雑なテキストにおいて、重複する・断片的なエンティティ表記の認識を向上させること。
  • 逐次モデルにおける訓練(ゴールド中間結果の使用)と推論(モデルが予測した出力の使用)の不一致を解消すること。
  • 1段階でスパン境界とエンティティ接続性を同時に学習する手法を開発し、誤差の伝搬を回避すること。
  • SOTAの遷移ベースおよび組み合わせベースのモデルに比べ、より高い精度と高速な推論速度を達成すること。

提案手法

  • 各文ごとにセグメントグラフを構築し、ノードは候補スパン(連続的または断片的エンティティの一部)を表し、同じエンティティに属するスパン同士を結ぶエッジを設ける。
  • 1段階でスパン境界(スパン抽出)とセグメント間接続(エッジ予測)を独立して予測する2次元グリッドタギング方式を採用する。
  • スパン境界の予測を、スパン境界を特定するためのトークンペアへのタグ割り当てというラベル付けタスクとしてモデル化し、重複・断片的スパンの検出を可能にする。
  • エッジ予測を、同じエンティティに属する境界トークンのアライメントとしてモデル化し、グリッド上での学習されたアテンション機構を用いて長距離依存性を捉える。
  • 最終的なNERタスクを、構築されたグラフ内での非パrametric的かつ最大クリーク探索問題に再定式化し、各クリークが完全なエンティティ表記に対応するようにする。
  • グリーディ法または正確な最大クリーク検出アルゴリズムを用いて、重複を避けつつ最大限のカバレッジを確保しながら、グラフ内からすべての有効なエンティティを抽出する。

実験結果

リサーチクエスチョン

  • RQ1断片的NERは、グラフベースの最大クリーク探索問題として効果的に再定式化可能か?
  • RQ21段階でスパン境界とエンティティ接続性を同時に学習することで、逐次モデルにおける露出バイアスは解消可能か?
  • RQ32次元グリッドタギングフレームワークは、逐次パイプラインに比べ、重複・断片的スパンをより効果的に統合的にモデル化可能か?
  • RQ4提案されたMacモデルは、断片的NERベンチマークにおいてSOTAモデルに比べ優れた性能と効率を達成するか?
  • RQ5Macは、断片的表記における異なる間隔とスパン長に対して、どの程度頑健か?

主な発見

  • Macは3つの断片的NERベンチマークでSOTA性能を達成し、前回のSOTAに比べ最大3.5ポイントのF1スコア向上を達成した。
  • CADECデータセットでは、前回の最高結果に比べF1スコアが3.5ポイント向上し、臨床テキストにおける強力な有効性を示した。
  • 推論速度は5倍向上し、Tesla V100 GPU上で1秒間に193.3文を処理した。これはSOTAモデルであるTrans Eの36.3文/秒に比べて顕著な高速化である。
  • スパン長や間隔長が異なる状況でも高い性能を維持しており、特に長スパンや大きな間隔に対して一貫して優位性を示した。
  • 間隔長が1でスパン長が3の稀なケースでも頑健性を示したが、わずかに性能が低下する傾向があり、挑戦的なエッジケースであることが示唆された。
  • アブレーションスタディにより、2次元グリッドタギング方式による統合的学習が不可欠であることが確認された。これは露出バイアスを解消し、エンドツーエンド最適化を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。