Skip to main content
QUICK REVIEW

[論文レビュー] What do we Really Know about State of the Art NER?

Sowmya Vajjala, Ramya Balasubramaniam|arXiv (Cornell University)|Apr 29, 2022
Topic Modeling被引用数 10
ひとこと要約

この論文は、一般的に使用されるデータセットを用いて、複数のSOTA Named Entity Recognition (NER) モデルの性能を、多様なテキストジャンル、敵対的摂動、および分布外設定において評価することで、最先端のNERモデルの限界を批判的に検討している。3つのSOTAモデルを用いた分析から、未確認のジャンルや敵対的例において顕著な性能低下が生じることが明らかになった。これにより、NER研究における透明性と耐性評価の向上を目的として、より包括的な報告慣行の導入が提唱されている。

ABSTRACT

Named Entity Recognition (NER) is a well researched NLP task and is widely used in real world NLP scenarios. NER research typically focuses on the creation of new ways of training NER, with relatively less emphasis on resources and evaluation. Further, state of the art (SOTA) NER models, trained on standard datasets, typically report only a single performance measure (F-score) and we don't really know how well they do for different entity types and genres of text, or how robust are they to new, unseen entities. In this paper, we perform a broad evaluation of NER using a popular dataset, that takes into consideration various text genres and sources constituting the dataset at hand. Additionally, we generate six new adversarial test sets through small perturbations in the original test set, replacing select entities while retaining the context. We also train and test our models on randomly generated train/dev/test splits followed by an experiment where the models are trained on a select set of genres but tested genres not seen in training. These comprehensive evaluation strategies were performed using three SOTA NER models. Based on our results, we recommend some useful reporting practices for NER researchers, that could help in providing a better understanding of a SOTA model's performance in future.

研究の動機と目的

  • 標準的なベンチマーク評価を超えて、SOTA NERモデルが異なるテキストジャンルやドメインにどのように一般化するかを調査すること。
  • 文脈を保ったままエンティティを置き換える小さな摂動を加えた敵対的摂動に対して、SOTA NERモデルの耐性を評価すること。
  • 特定のジャンルのサブセットで学習し、未確認のジャンルでテストすることで、実世界の展開状況を模擬した一般化能力を評価すること。
  • 現在のNER評価慣行に見られる欠陥を特定し、モデルの挙動や信頼性の理解を妨げている要因を明らかにすること。
  • モデル性能の透明性と比較可能性を高めるために、NER研究における報告基準の改善を提言すること。

提案手法

  • 複数のテキストジャンルとデータソースをカバーする多様なデータセットを用いて、3つのSOTA NERモデルの包括的評価を実施した。
  • 元のテストセットのエンティティに対して、小さな変更を加えつつ文脈を保つ摂動を適用することで、6つの新しい敵対的テストセットを生成した。
  • 学習・検証・テストの分割をランダムに生成し、データ分割の違いによる安定性を評価した。
  • 特定のジャンルのサブセットでモデルを学習し、未確認のジャンルで評価することで、一般化能力をテストした。
  • F1スコアといった標準的な指標に加え、エンティティタイプごいやジャンルごとのパフォーマンスを分析することで、隠れた性能のばらつきを特定した。
  • 全体のF1スコアに加え、エンティティタイプやジャンルごとの結果を報告することで、モデル挙動の細分化された分析を可能にした。

実験結果

リサーチクエスチョン

  • RQ11つのデータセット内において、SOTA NERモデルは異なるテキストジャンルやデータソースでどのように性能を発揮するか?
  • RQ2文脈を保ったままエンティティを置き換える小さな摂動に対して、SOTA NERモデルはどの程度耐性を示すか?
  • RQ3学習時に見なかったジャンルでテストした場合、モデルの性能はどの程度低下するか?
  • RQ4現在の評価慣行は、SOTA NERモデルの真の能力と限界をどの程度隠蔽しているか?
  • RQ5NERモデル評価の透明性と信頼性を高めるために、どのような報告慣行が有効か?

主な発見

  • SOTA NERモデルは、未確認のテキストジャンルで評価された場合、20 F1ポイント以上の低下を示すことがあり、一般化能力に著しい欠陥があることが判明した。
  • エンティティが置き換えられた敵対的テストセットでは、一部のモデルでF1スコアが最大15ポイント低下し、わずかな入力変更に対して極めて脆弱であることが明らかになった。
  • エンティティタイプごとの性能に顕著な差が見られ、リソースが少ないタイプ(例:'Event' や 'Title')は 'Person' や 'Location' といったリソースが豊富なタイプに比べ、再現率とF1スコアが著しく低かった。
  • ランダムな学習/検証/テスト分割を用いた評価では、実行ごとに性能にばらつきが生じ、標準的なプロトコル下でも評価の不安定性が顕在化した。
  • 特定のジャンルのサブセットで学習したモデルは、未確認のジャンルで著しく性能を発揮できず、特定ドメインの特性に過学習しているリスクが浮き彫りになった。
  • 本研究は、全体のF1スコアに依存するだけでは、モデルの能力を不完全かつしばしば誤解を招く形でしか把握できないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。