Skip to main content
QUICK REVIEW

[論文レビュー] Three-level Hierarchical Transformer Networks for Long-sequence and Multiple Clinical Documents Classification

Yuqi Si, Kirk Roberts|arXiv (Cornell University)|Apr 17, 2021
Machine Learning in Healthcare被引用数 5
ひとこと要約

本論文では、単語から文、文から臨床ノート、ノートから患者水準の結果に至るまで、情報を段階的に処理する3段階の階層的トランスフォーマーネットワークを提案する。BERTの文脈長を拡張し、時刻に適応した自己適応的セグメンテーションを組み込むことで、MIMIC-IIIにおける入院中死亡リスク予測および表現型予測タスクで、AUCが最大21%向上、PRCが51%向上、F1スコアが46%向上する最先端の性能を達成した。

ABSTRACT

We present a Three-level Hierarchical Transformer Network (3-level-HTN) for modeling long-term dependencies across clinical notes for the purpose of patient-level prediction. The network is equipped with three levels of Transformer-based encoders to learn progressively from words to sentences, sentences to notes, and finally notes to patients. The first level from word to sentence directly applies a pre-trained BERT model as a fully trainable component. While the second and third levels both implement a stack of transformer-based encoders, before the final patient representation is fed into a classification layer for clinical predictions. Compared to conventional BERT models, our model increases the maximum input length from 512 tokens to much longer sequences that are appropriate for modeling large numbers of clinical notes. We empirically examine different hyper-parameters to identify an optimal trade-off given computational resource limits. Our experiment results on the MIMIC-III dataset for different prediction tasks demonstrate that the proposed Hierarchical Transformer Network outperforms previous state-of-the-art models, including but not limited to BigBird.

研究の動機と目的

  • 長期間の臨床ノートをモデル化する際のBERTの512トークン制限を克服すること。
  • 1人の患者にわたる複数の臨床文書間の階層的かつ時間的依存関係を捉えること。
  • 入院中死亡リスクや表現型分類などの患者水準の臨床結果予測の正確性を向上させること。
  • ハイパーパramータチューニングと分散学習を活用して、計算制約下でのモデル性能最適化を図ること。
  • 隔離されたノート(例:退院時サマリー)に依存するのではなく、完全な長期間のノートシーケンスを組み込む必要性を示すこと。

提案手法

  • 単語から文へのレベルで、事前学習済みBERTモデルを用いて文脈的な表現を抽出する。
  • 文からノートへの集約用と、ノートから患者分類へのための、2つの追加のトランスフォーマーベースのエンコーダースタックを実装する。
  • 臨床ノートを時刻的近接性に基づいてグループ化する、時刻に適応した自己適応的セグメンテーションを導入する。
  • 文レベルおよびノートレベルでの表現を集約するために、mean_maxプーリングを用い、階層的特徴学習を強化する。
  • すべての3段階で位置エンコーディングを適用し、シーケンスの順序を意識した認識を維持する。
  • GPUメモリ制限を克服し、BERTの標準的な制限を超える長大な入力シーケンスを処理可能にするために、分散学習を活用する。

実験結果

リサーチクエスチョン

  • RQ1階層的トランスフォーマー構造は、複数の患者ノートにわたる長期間の臨床シーケンスを効果的にモデル化できるか?
  • RQ2自己適応的セグメンテーションによる時間的構造の組み込みは、ノートを独立した単位として扱う場合と比較して、臨床予測性能をどのように向上させるか?
  • RQ3臨床シーケンスモデリングにおいて、モデルサイズ、入力長、計算コストの最適なトレードオフは何か?
  • RQ4退院時サマリーのみではなく、すべての利用可能な臨床ノートを使用することで、予測性能が顕著に向上するか?
  • RQ5プーリング戦略、エンコーダー層の数、位置エンコーディングといった、アーキテクチャのどの要素がモデル性能に最も大きな影響を与えるか?

主な発見

  • 提案された階層的トランスフォーマーネットワークは、入院中死亡リスク予測において、BigBirdなどの先行SOTAモデルを上回る最大21%のAUC向上を達成した。
  • 表現型予測タスクにおいても、PRCが51%向上、F1スコアが46%向上し、複数の指標で顕著な向上を示した。
  • すべての利用可能な臨床ノート(退院時サマリーのみでない)を用いることで性能が著しく向上し、1つのノートのみを使用するとAUCが約0.85に低下した。
  • 最良の性能を示したモデルは、文レベルおよびドキュメントレベルで2層のエンコーダーを使用しており、最適化のボトル neck により、より大きなモデルが必ずしも優れた結果をもたらさないことが示された。
  • 自己適応的セグメンテーションは不可欠であり、これを削除するとAUCは0.8558に低下し、PRCは0.7887に低下し、時間的関係を保持する役割が顕著に示された。
  • mean_maxプーリングは他のプーリング戦略を上回り、位置エンコーディングは階層的レベル間でのシーケンス順序認識を維持するために不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。