Skip to main content
QUICK REVIEW

[論文レビュー] Phenotyping of Clinical Notes with Improved Document Classification Models Using Contextualized Neural Language Models

Andriy Mulyar, Elliot Schumacher|arXiv (Cornell University)|Oct 30, 2019
Topic Modeling参考文献 18被引用数 21
ひとこと要約

本稿では、文書の断片に分けて文脈を考慮したBERT表現の平均プーリングを用いて文書レベルの埋め込みを生成する、BERTベースの文書分類フレームワークを提案する。この手法は、I2B2 2006年の喫煙状態のフェノタイピングタスクで最先端の性能を達成し、従来のルールベースのシステムよりも微小F1で2.8%優れている。これは、文脈を考慮した言語モデルを用いる場合、複雑なアーキテクチャに頼らずに単純なプーリング戦略でも十分に機能することを示している。

ABSTRACT

Clinical notes contain an extensive record of a patient's health status, such as smoking status or the presence of heart conditions. However, this detail is not replicated within the structured data of electronic health systems. Phenotyping, the extraction of patient conditions from free clinical text, is a critical task which supports avariety of downstream applications such as decision support and secondary use of medical records. Previous work has resulted in systems which are high performing but require hand engineering, often of rules. Recent work in pretrained contextualized language models have enabled advances in representing text for a variety of tasks. We therefore explore several architectures for modeling pheno-typing that rely solely on BERT representations of the clinical note, removing the need for manual engineering. We find these architectures are competitive with or outperform existing state of the art methods on two phenotyping tasks.

研究の動機と目的

  • 文脈を考慮したニューラル言語モデルを用いて、一般化可能でエンドツーエンドの臨床ノート用文書分類フレームワークを開発すること。
  • 否定検出や時系列フレーズ認識などの手動特徴工学を避けるために、事前学習済みBERT表現を活用すること。
  • 長文文書のフェノタイピングタスクにおいて、LSTMやマルチヘッド自己注意機構のような複雑なアーキテクチャよりも、単純な集約手法(例:平均プーリング)が優れた性能を発揮するかどうかを評価すること。
  • BERTベースのモデルが、喫煙状態と肥満関連合併存疾患の2つの標準的フェノタイピングベンチマークでどのように性能を発揮するかを評価すること。
  • 再現可能性と臨床NLP分野への広範な採用を促進するため、公開可能なPyTorch実装を提供すること。

提案手法

  • 臨床ノートはWordPieceトークン化を用いて、512(BERTの最大入力長)の長さの重複のないセグメントに分割される。
  • 各セグメントは、臨床分野にファインチューニングされたBERTモデルを用いてエンコードされ、各サブワードトークンの文脈を考慮した隠れ状態が得られる。
  • 文書レベルの表現は、4つの集約戦略(平均プーリング、最大プーリング、LSTMベースのエンコーディング、マルチヘッド自己注意(Transformerベースのプーリング))を用いて構築される。
  • プールドされた表現は、シグモイド活性化関数を用いた全結合分類器を通過し、フェノタイプ的特徴の二値またはマルチラベル分類が行われる。
  • ハイパーパramータチューニングが不可である(開発セットが存在しないため)ため、1000エポックでI2B2 2006(喫煙)およびI2B2 2008(肥満)の共有タスクデータセット上でエンドツーエンドでモデルを学習する。
  • ルールベースの前処理を避ける代わりに、文脈埋め込みにのみ依存することで、タスク固有の工学的設計を必要とせず、多様なフェノタイプ的特徴に適応可能となる。

実験結果

リサーチクエスチョン

  • RQ1手動特徴やルールベースのコンponentsを一切用いずに、BERTベースの文書分類モデルが臨床フェノタイピングタスクで最先端の性能を達成できるか?
  • RQ2文書セグメント全体にわたるBERT表現の平均プーリングが、LSTMやマルチヘッドアテンションのようなより複雑な集約アーキテクチャよりも優れた性能を発揮するか?
  • RQ3BERTベースのモデルは、標準的なフェノタイピングベンチマークで、従来のルールベースおよびCNNベースのシステムと比較してどのように性能を発揮するか?
  • RQ4標準BERTアプリケーションで一般的に使用される最初の510トークンのみに依存する場合、モデルの性能がどの程度低下するか?
  • RQ5BERTからの文脈を考慮した表現は、単純で学習されないプーリング戦略と組み合わせていても、フェノタイプ信号を十分に捉えるのに十分か?

主な発見

  • 平均プーリング戦略($f_{\text{mean}}$)は、I2B2 2006喫煙状態フェノタイピングタスクで微小F1 92.8を達成し、前回の共有タスク優勝者(90.0)を2.8ポイント上回った。
  • $f_{\text{mean}}$アーキテクチャは、I2B2 2008肥満関連合併存疾患タスクでも最高のF1(86.5)を記録したが、メジャリティラベルベースラインに対してのみ、共有タスクで1位のシステム(95.0)を上回った。
  • Transformerベースのプーリング手法($f_{\text{Transformer}}$)は、すべてのベースラインを下回り、喫煙タスクでF1 58.4、肥満タスクでF1 70.4を記録した。これは、モデル容量の増加が低データ環境では恩恵をもたらさない可能性を示唆している。
  • LSTMベースのプーリング手法($f_{I}$)は、喫煙タスクでF1 92.3、肥満タスクでF1 83.1を達成し、競争力はあったが、平均プーリングを上回ることはできなかった。
  • ベースラインのDocBertモデル(最初の510トークンのみを用いる)は、喫煙タスクでF1 80.2、肥満タスクでF1 67.6にとどまり、これは長文臨床ノートにおける重要な情報を捉えられていないことを確認している。
  • 本研究では、BERT表現の単純な平均プーリングが、臨床文書分類で高い性能を発揮するのに十分であることが示された。これにより、複雑でタスク固有のアーキテクチャを設計する必要がなくなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。