Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adaptation for Named Entity Recognition in Online Media with Word Embeddings

Vivek Kulkarni, Yashar Mehdad|arXiv (Cornell University)|Dec 1, 2016
Topic Modeling参考文献 23被引用数 8
ひとこと要約

本稿では、ファイナンスやスポーツなど、ドメイン間の言語的変動を捉えるドメイン固有の単語埋め込みを学習する手法であるDomainDistを提案する。この手法により、名前付きエンティティ抽出(NER)におけるドメイン適応が効果的に可能となり、ターゲットドメインにおけるラベル付きデータが最小限でも、最先端のF1スコアを達成する。無教師のドメイン固有埋め込みとアクティブラーニングを活用することで、ファイナンスおよびスポーツのNERタスクにおいて、先行研究のベースラインを上回る性能を発揮する。

ABSTRACT

Content on the Internet is heterogeneous and arises from various domains like News, Entertainment, Finance and Technology. Understanding such content requires identifying named entities (persons, places and organizations) as one of the key steps. Traditionally Named Entity Recognition (NER) systems have been built using available annotated datasets (like CoNLL, MUC) and demonstrate excellent performance. However, these models fail to generalize onto other domains like Sports and Finance where conventions and language use can differ significantly. Furthermore, several domains do not have large amounts of annotated labeled data for training robust Named Entity Recognition models. A key step towards this challenge is to adapt models learned on domains where large amounts of annotated training data are available to domains with scarce annotated data. In this paper, we propose methods to effectively adapt models learned on one domain onto other domains using distributed word representations. First we analyze the linguistic variation present across domains to identify key linguistic insights that can boost performance across domains. We propose methods to capture domain specific semantics of word usage in addition to global semantics. We then demonstrate how to effectively use such domain specific knowledge to learn NER models that outperform previous baselines in the domain adaptation setting.

研究の動機と目的

  • ファイナンスやスポーツのような低リソースドメインにおける、言語的変動とアノテート済みデータの不足による、NER性能の低さという課題に対処すること。
  • ファイナンスやスポーツのようなドメイン間で、語の意味的性質や用法がどのように異なるかを、分散表現を用いて分析すること。
  • ドメイン固有の言語的変動を明示的にモデル化することで、ドメイン適応設定におけるNER性能を向上させる手法を開発すること。
  • ドメイン固有の埋め込みが、ターゲットドメインにおける人為的アノテーションデータが最小限でも、NER性能を顕著に向上させられることを実証すること。

提案手法

  • ドメイン固有の意味的性質を捉えつつも、グローバルな意味的構造を維持するように、各ドメインごとに別々の単語埋め込みを学習するニューラル言語モデルであるDomainDistを提案する。
  • DomainDistモデルの出力層を用いてドメイン固有の単語表現を抽出し、ドメインの曖昧性解消と言語的変動の分析を可能にする。
  • ドメイン固有の埋め込みと、人間によるアノテーションに最も有益な文を能動的に選択する仕組みを備えた、半教師付きNERフレームワークであるActiveDomainDistNERを導入する。
  • 2段階の学習プロセスを採用する:まず、大規模な未ラベル付きテキスト上でドメイン固有の埋め込みを事前学習し、次に、ターゲットドメインの少量のラベル付き例を用いてNERモデルをファインチューニングする。
  • 語の意味の分布をドメインごとにモデル化することで、語の意味のシフト(例:「Goldman」がスポーツでは人物、ファイナンスでは組織として用いられる)を明示的に定量化する。
  • 構造的対応学習の原則を応用し、ドメイン固有の埋め込みを共有される意味的空間に整合させることで、ドメイン間での一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ファイナンスやスポーツのような異なるドメイン間で、語の用法や意味がどのように異なるか。また、その差異を定量的にモデル化できるか。
  • RQ2ドメイン固有の単語埋め込みは、ラベル付きデータが限られた低リソースドメインにおけるNER性能を向上させられるか。
  • RQ3無教師のドメイン固有埋め込みを用いることで、NERタスクにおける大規模な手作業によるアノテーションの必要性をどの程度低減できるか。
  • RQ4新しいドメインにおけるNERタスクにおいて、ドメイン固有埋め込みに基づくアクティブラーニングは、ランダムサンプリングに比べて、どの程度ラベル付け作業の負荷を軽減できるか。

主な発見

  • 提案されたActiveDomainDistNER手法は、ファイナンスドメインで1,500件の手動ラベル付き文を用いてF1スコア69.79を達成し、スポーツドメインでは86.78を達成した。
  • ドメイン固有の埋め込みは、ファイナンスおよびスポーツのNERタスクにおいて、汎用単語埋め込みや先行するドメイン適応ベースラインを顕著に上回った。
  • わずか500件のラベル付き文でも、ファイナンスでF1スコア67.68、スポーツで83.94を達成し、優れたデータ効率性を示した。
  • 「Goldman」がスポーツでは人物として、ファイナンスでは組織として用いられるという、意味的変動の重要な側面を、埋め込み空間の2次元プロットで示すことで、意味のある言語的変動を捉えた。
  • より多くの能動的に選択された学習例を用いるほど、モデルの性能が滑らかに向上し、優れたサンプル効率性を示した。
  • テストされたすべてのデータ比において、本手法は競合するベースラインを上回った。ドメイン固有の意味的モデリングがNERにおいて有効であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。