Skip to main content
QUICK REVIEW

[論文レビュー] May I Check Again? -- A simple but efficient way to generate and use contextual dictionaries for Named Entity Recognition. Application to French Legal Texts

Valentin Barrière, Amaury Fouret|arXiv (Cornell University)|Sep 8, 2019
Natural Language Processing Techniques参考文献 22被引用数 6
ひとこと要約

本稿では、Damerau-Levenshtein距離および最長共通部分列(LCS)距離を用いて動的に文脈に適したエンティティ辞書を生成することで、フランス語法的文書における名前付きエンティティ認識(NER)を向上させる文脈に配慮した手法MICAを提案する。ニューラルNERモデルの最終層に類似度ベースの特徴を組み込むことで、綴りの誤りに対する耐性が向上し、F1スコアが1.67ポイント上昇(94.85%から96.52%)し、相対的リcallエラーは40.9%低減される。

ABSTRACT

In this paper we present a new method to learn a model robust to typos for a Named Entity Recognition task. Our improvement over existing methods helps the model to take into account the context of the sentence inside a court decision in order to recognize an entity with a typo. We used state-of-the-art models and enriched the last layer of the neural network with high-level information linked with the potential of the word to be a certain type of entity. More precisely, we utilized the similarities between the word and the potential entity candidates in the tagged sentence context. The experiments on a dataset of French court decisions show a reduction of the relative F1-score error of 32%, upgrading the score obtained with the most competitive fine-tuned state-of-the-art system from 94.85% to 96.52%.

研究の動機と目的

  • 綴りの誤りやドメイン固有の言語による影響により、フランス語法的文書におけるNER性能が低いという課題に対処すること。
  • 法的文書における綴りの誤りやノイズの多い入力に対して、最先端のNERモデルの耐性を高めること。
  • ファインチューニングされた言語埋め込みと文脈に敏感なエンティティ候補生成を用いて、ドメインに適応したNERシステムを開発すること。
  • 正確性を損なわせることなく、脱識別化タスクにおける偽陰性を最小限に抑えることで、リcallを向上させること。
  • フランス語法的文書を超えた他のNER設定にも適用可能な言語およびドメインに依存しない手法を構築すること。

提案手法

  • スタックド埋め込み(FastText、文字レベルBiLM、文字レベル埋め込み)を用いてベースのBLSTM-CRF NERモデルを学習する。
  • 各文に対して、最適なサイズ:128)の文脈ウィンドウを取得し、最初のモデルの予測から潜在的な名前付きエンティティを抽出する。
  • Damerau-Levenshtein距離および最長共通部分列(LCS)距離を用いて、各単語とエンティティ候補との類似度スコアを計算する。
  • 各単語ごとに、特定のエンティティタイプ(例:PER、LOC)である可能性を表す類似度ベクトルを生成する。
  • この類似度ベクトルを、2番目のNERモデルの最終層に高レベル特徴として注入して予測を精緻化する。
  • 66万件のフランス語法的文書コーパス上でFastTextおよびBiLM埋め込みをファインチューニングしてドメイン適応を向上させる。

実験結果

リサーチクエスチョン

  • RQ1文脈に配慮したエンティティ候補生成は、フランス語法的文書における綴りの誤りに対するNERの耐性を向上させることができるか?
  • RQ2文脈ウィンドウのサイズは、文脈的辞書手法の性能にどのように影響するか?
  • RQ3エンティティ候補から導出される類似度ベースの特徴は、NERの精度およびリcallをどの程度向上させることができるか?
  • RQ4ニューラルNERモデルの最終層に高レベルの文脈特徴を注入することは、標準的なファインチューニングを上回る性能を発揮するか?
  • RQ5この手法は、フランス語法的文書を超えた他のドメインや言語にも一般化可能か?

主な発見

  • MICA手法は、最良のファインチューニングベースラインと比較して、相対的F1スコアエラーを32%低減し、F1スコアを94.85%から96.52%まで向上させた。
  • エンティティ候補生成の最適な文脈ウィンドウサイズは128トークンであり、それ以上に拡大すると精度が低下するため性能が劣化する。
  • このシステムは、ベースラインと比較して相対的リcallエラーを40.9%低減し、脱識別化の完全性が著しく向上した。
  • 辞書作成に最初のモデルの予測結果を使用しても、偽陽性率は安定したままであった。
  • 法的文書上でFastTextおよびBiLM埋め込みをファインチューニングすることでモデル性能が向上し、ドメイン適応表現の価値が裏付けられた。
  • このアプローチは、CRFベースのNERシステムに対しても有効であり、深層学習でないモデルとも互換性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。