Skip to main content
QUICK REVIEW

[論文レビュー] The Benefits of Word Embeddings Features for Active Learning in Clinical Information Extraction

Mahnoosh Kholghi, Lance De Vine|arXiv (Cornell University)|Jul 11, 2016
Topic Modeling参考文献 9被引用数 9
ひとこと要約

本稿では、臨床情報抽出のためのアクティブラーニングフレームワークにおいて、教師なし単語埋め込みと手作業特徴量を統合することを提案し、アノテーション作業を顕著に削減する。スキップグラム単語埋め込みと系列表現を、多様な不確実性サンプリング戦略と組み合わせることで、2つの臨床データセットにおいてベースライン手法と比較して、概念アノテーション率を最大10%、トークンアノテーション率を最大9%削減する。

ABSTRACT

This study investigates the use of unsupervised word embeddings and sequence features for sample representation in an active learning framework built to extract clinical concepts from clinical free text. The objective is to further reduce the manual annotation effort while achieving higher effectiveness compared to a set of baseline features. Unsupervised features are derived from skip-gram word embeddings and a sequence representation approach. The comparative performance of unsupervised features and baseline hand-crafted features in an active learning framework are investigated using a wide range of selection criteria including least confidence, information diversity, information density and diversity, and domain knowledge informativeness. Two clinical datasets are used for evaluation: the i2b2/VA 2010 NLP challenge and the ShARe/CLEF 2013 eHealth Evaluation Lab. Our results demonstrate significant improvements in terms of effectiveness as well as annotation effort savings across both datasets. Using unsupervised features along with baseline features for sample representation lead to further savings of up to 9% and 10% of the token and concept annotation rates, respectively.

研究の動機と目的

  • アクティブラーニングにおける教師なし単語埋め込みの活用により、臨床情報抽出における手作業アノテーションコストを低減すること。
  • 従来の手作業特徴量と比較して、単語埋め込みがサンプル選択の有効性を向上させるかどうかを評価すること。
  • 教師なし特徴量と手作業特徴量の統合が、アノテーション効率とモデル性能に与える影響を調査すること。
  • 臨床NLPの文脈において、最小信頼度、情報多様性、情報密度、ドメイン知識の情報性といった複数の不確実性サンプリング基準を評価すること。
  • i2b2/VA 2010およびShARe/CLEF 2013の2つの実世界臨床データセットを用いて、手法の妥当性を検証すること。

提案手法

  • 本手法は、臨床テキスト上で学習されたスキップグラム単語埋め込みを用い、単語の密な分散表現を生成する。
  • 文脈特徴を組み合わせることで、単語埋め込みと文脈特徴を統合し、系列レベルの文脈をモデル化する表現を構築する。
  • 教師なし単語埋め込みと従来の手作業特徴量(品詞タグ、句構造パターンなど)を連結することで、ハイブリッド特徴表現を生成する。
  • アクティブラーニングは、最小信頼度、情報多様性、情報密度、ドメイン知識の情報性といった複数の基準を用いて、最も情報量の多いサンプルを選択する。
  • モデルは、最も情報量の多いサンプルに対して繰り返し再訓練され、全範囲のアノテーションの必要性が低下する。
  • F1スコアとアノテーション効率の指標を用いて、2つの臨床データセットで性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1アクティブラーニングに単語埋め込みを統合することで、ベースラインの手作業特徴量と比較して、臨床情報抽出の有効性が向上するか?
  • RQ2どの程度、単語埋め込みの導入により、目標性能に到達するためのアノテーション数が削減されるか?
  • RQ3臨床テキストにおいて、単語埋め込みと組み合わせた場合、異なる不確実性サンプリング戦略の性能はいかがなっているか?
  • RQ4教師なし特徴量と手作業特徴量の統合は、単独で用いる場合よりも、より高いアノテーション効率をもたらすか?
  • RQ5単語埋め込みの利点は、異なる臨床テキストデータセットに一般化可能か?

主な発見

  • 手作業特徴量と単語埋め込みの統合により、ベースライン手法と比較して概念アノテーション率が最大10%削減された。
  • アクティブラーニングにおけるハイブリッド特徴表現の使用により、トークンレベルのアノテーション作業が最大9%削減された。
  • 単語埋め込みとアクティブラーニングの組み合わせにより、i2b2/VA 2010およびShARe/CLEF 2013の両データセットで、少ないアノテート済みサンプルで高いF1スコアが達成された。
  • 情報多様性とドメイン知識の情報性の基準は、単語埋め込みと組み合わせた際、特に効果的であった。
  • スキップグラム単語埋め込みは、臨床的に関連する意味的パターンを捉える点で、静的単語表現を上回った。
  • ハイブリッド特徴アプローチは、テストされたすべての不確実性サンプリング戦略において一貫して性能を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。