Skip to main content
QUICK REVIEW

[論文レビュー] Few-Shot Nested Named Entity Recognition

Ming Hong, Jiaoyun Yang|arXiv (Cornell University)|Dec 2, 2022
Topic Modeling被引用数 5
ひとこと要約

本論文は、スパン依存関係表現と対照的学習を活用して、限られたラベル付きデータでネスト型名前付きエンティティを区別できる、Biaffineベースの対照的学習(BCL)フレームワークを提案する。この手法は、英語、ドイツ語、ロシア語のデータセットにおいて、5ショット設定下でベースラインを最大5.57% F1スコア向上させ、最先端の性能を達成した。

ABSTRACT

While Named Entity Recognition (NER) is a widely studied task, making inferences of entities with only a few labeled data has been challenging, especially for entities with nested structures. Unlike flat entities, entities and their nested entities are more likely to have similar semantic feature representations, drastically increasing difficulties in classifying different entity categories in the few-shot setting. Although prior work has briefly discussed nested structures in the context of few-shot learning, to our best knowledge, this paper is the first one specifically dedicated to studying the few-shot nested NER task. Leveraging contextual dependency to distinguish nested entities, we propose a Biaffine-based Contrastive Learning (BCL) framework. We first design a Biaffine span representation module for learning the contextual span dependency representation for each entity span rather than only learning its semantic representation. We then merge these two representations by the residual connection to distinguish nested entities. Finally, we build a contrastive learning framework to adjust the representation distribution for larger margin boundaries and more generalized domain transfer learning ability. We conducted experimental studies on three English, German, and Russian nested NER datasets. The results show that the BCL outperformed three baseline models on the 1-shot and 5-shot tasks in terms of F1 score.

研究の動機と目的

  • ラベル付き例が非常に少ない状況でネスト型名前付きエンティティを認識する課題に対処すること。
  • 低リソース環境下で共有される意味的表現のためのネスト型エンティティの区別が困難になる問題を克服すること。
  • より判別性の高いスパン表現を学習することで、少数ショット学習における一般化性能とドメイン転送性能を向上させること。
  • ラベル空間が一貫しないドメイン間の転移学習におけるラベル不一致問題を軽減すること。
  • 提案されたフレームワークの有効性を多言語ネスト型NERデータセット上で検証すること。

提案手法

  • 単語間およびエンティティスパン内・間の文脈的依存パターンを学習するため、スパン表現モジュールにBiaffine構造を設計した。
  • 残差接続を用いて単語レベルの意味表現とスパンレベルの依存関係表現を統合し、判別性を向上させた。
  • 円形損失(circle loss)を用いた対照的学習目的関数を適用し、正例ペアを離隔させ、表現空間におけるマージン境界を拡大した。
  • 多言語事前学習言語モデル(BERT-base-multilingual)を用いて、多言語的転送とドメイン適応を実現した。
  • エンティティタイプごとに1~5例のラベル付き例から成るサポートセットを用いて、エンドツーエンドでモデルを学習し、クエリセットに対して推論を実行した。
  • 対照的損失にバイアス項を導入し、最も相違する正例ペアに注目することで、表現学習の性能を向上させた。
(a) Example of a sentence with nested entities.
(a) Example of a sentence with nested entities.

実験結果

リサーチクエスチョン

  • RQ11つまたは数個のラベル付き例しか利用できない状況で、少数ショット学習フレームワークがネスト型名前付きエンティティを効果的に認識できるか。
  • RQ2スパンレベルの依存関係表現は、低リソース環境下でネスト型エンティティとフラットエンティティの区別をどのように向上させるか。
  • RQ3マージンに基づく損失を用いた対照的学習は、少数ショットネスト型NERにおける一般化性能とドメイン転送性能をどの程度向上させるか。
  • RQ4Biaffine構造と残差接続の統合は、ネスト型エンティティ認識性能にどのように影響を与えるか。
  • RQ5提案されたフレームワークは、特にインド・ヨーロッパ語族にまたがる言語間で一般化可能か。

主な発見

  • BCLフレームワークは、3つのデータセット(英語、ドイツ語、ロシア語)の両1ショットおよび5ショット設定で、3つのベースラインモデルを上回り、GENIAデータセットの5ショット設定ではベースライン比でF1スコアを5.57%絶対値で向上させた。
  • アブレーションスタディの結果、Biaffineレイヤーが性能向上に最も寄与しており、1ショットと5ショット設定でそれぞれF1を1.73%および5.57%向上させた。
  • 意味的表現と依存関係表現の間の残差接続を削除すると、1ショットと5ショット設定でそれぞれF1が1.76%および1.29%低下し、表現統合における重要性が示された。
  • 対照的損失にバイアス項を含めることで、1ショットと5ショット設定でそれぞれF1が1.38%および2.05%向上し、ハード正例ペアへの注目が向上したことが示された。
  • 多言語BERTモデルを用いることで、英語データセットではキャップド英語BERTに比べてわずかに性能が低下したが、差は最小限であり、多言語モデルを用いた多言語的転送の有効性が裏付けられた。
  • フラットNERベンチマークでもBCLは競争力のある結果を達成したが、特に1~2ショット設定では正例サンプルが限られるため、分布学習の観点から性能差が顕在化した。
(b) Span representations from BERT model (left) and BCL model (right).
(b) Span representations from BERT model (left) and BCL model (right).

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。