Skip to main content
QUICK REVIEW

[論文レビュー] TURNER: The Uncertainty-based Retrieval Framework for Chinese NER

Zhichao Geng, Hang Yan|arXiv (Cornell University)|Feb 18, 2022
Topic Modeling被引用数 5
ひとこと要約

TURNER は、モンテカルロドロップアウトまたはトップ-Kラベルシーケンスを用いて、中国語 NER のための未知の要因に基づく検索フレームワークであり、不確実性の高いエンティティレベルのコンponentsを同定し、それらをクエリとして外部知識を検索することで、性能を向上させる。このフレームワークは、検索された知識を統合する統合モデルに効果的に統合することで、強力なベースラインに対して平均で F1 スコアを 1.1% 向上させ、新たな SOTA 結果を達成した。

ABSTRACT

Chinese NER is a difficult undertaking due to the ambiguity of Chinese characters and the absence of word boundaries. Previous work on Chinese NER focus on lexicon-based methods to introduce boundary information and reduce out-of-vocabulary (OOV) cases during prediction. However, it is expensive to obtain and dynamically maintain high-quality lexicons in specific domains, which motivates us to utilize more general knowledge resources, e.g., search engines. In this paper, we propose TURNER: The Uncertainty-based Retrieval framework for Chinese NER. The idea behind TURNER is to imitate human behavior: we frequently retrieve auxiliary knowledge as assistance when encountering an unknown or uncertain entity. To improve the efficiency and effectiveness of retrieval, we first propose two types of uncertainty sampling methods for selecting the most ambiguous entity-level uncertain components of the input text. Then, the Knowledge Fusion Model re-predict the uncertain samples by combining retrieved knowledge. Experiments on four benchmark datasets demonstrate TURNER's effectiveness. TURNER outperforms existing lexicon-based approaches and achieves the new SOTA.

研究の動機と目的

  • 中国語 NER におけるコーパスベースの手法の限界に対処する。具体的には、動的ドメインにおいて保守が困難な高品質で静的である必要があるコーパスを必要とする点。
  • 入力テキストの最も不確実で曖昧なコンponentsに焦点を当てることで、NER における知識検索の効率性と有効性を向上させる。
  • 再トレーニングを必要とせず、意味情報を損なわず、動的に外部知識ソース(検索エンジンや知識グラフなど)を活用するフレームワークを開発する。
  • 不確実性サンプリングが的確な検索を誘導でき、不要なクエリを減らし、予測精度を向上させることを示す。

提案手法

  • ベース NER モデルからのモンテカルロドロップアウトまたはトップ-Kラベルシーケンスを用いて、入力テキスト内の不確実なエンティティレベルのコンponentsを同定する。
  • 不確実なコンponentsをクエリとして使用し、検索エンジンやオフライン知識グラフなどの外部ソースから補助的知識を検索する。
  • 元の入力、検索された知識、およびベースモデルの出力を組み合わせることで、不確実なサンプルを再予測する知識統合モデルを構築する。
  • オフライン知識グラフからの検索には BM25 を使用し、各主語を記述的ドキュメントに拡張して照合する。
  • 不確実性サンプリングの品質と効率を評価するために、サンプリング受容率(SAR)と価値のあるサンプリング率(VSR)を用いる。
  • GPU 使用量のトレードオフに基づき、MC ドロップアウト(第1段階のコストが高め)とトップ-K サンプリング(検索量が高め)の間で計算コストをバランスさせる。

実験結果

リサーチクエスチョン

  • RQ1不確実性サンプリングは中国語 NER において、最も曖昧なコンponentsを的確に同定でき、より効率的かつ効果的な知識検索を可能にするか?
  • RQ2すべてのエンティティに対してではなく、不確実なコンponentsに対してのみ知識を検索することで、NER の性能が著しく向上するか?
  • RQ3標準的な中国語 NER ベンチマークにおいて、TURNER は既存のコーパスベースの SOTA 手法と比較してどの程度の性能を示すか?
  • RQ4TURNER は、動的検索エンジンと静的知識グラフを含む、さまざまな知識ソースに一般化可能か?
  • RQ5MC ドロップアウトとトップ-K ラベルシーケンスサンプリングを用いた場合の、計算コストと検索有効性のトレードオフは何か?

主な発見

  • TURNER は、4つのベンチマークデータセットでベースの BERT ベース NER モデルを平均 F1 スコアで 1.1% 以上上回った。
  • 検索エンジンを用いた検索では、TURNER は MSRA、Ontonotes、Weibo、Resume データセットで既存のコーパスベース手法を上回り、新たな SOTA 結果を達成した。
  • オフライン知識グラフバージョンの TURNER は、ドメイン内データセット(MSRA、Ontonotes、Resume)においても、既存の SOTA コーパスベース手法を上回り、一般化能力を示した。
  • トップ-K ラベルシーケンスサンプリングは、MC ドロップアウトよりも高い VSR(Ontonotes で 0.071)とより優れたオラクル F1(92.3)を達成しており、有用な不確実コンponentsの再現率が優れていることを示している(MC ドロップアウト:VSR 0.018)。
  • トップ-K 法は、MC ドロップアウトよりも高い検索量(Ontonotes で平均 0.764 回/サンプル)を示したが、両手法とも最終的な性能は同等であった。
  • フレームワークは計算的に実行可能であり、GPU コスト分析から、MC ドロップアウトとトップ-K の選択は、システム制約とリソース使用のトレードオフに基づくことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。