[論文レビュー] Hi-BEHRT: Hierarchical Transformer-based model for accurate prediction of clinical events using multimodal longitudinal electronic health records
Hi-BEHRT は、階層的トランスフォーマーに基づくモデルであり、標準的なトランスフォーマーの受容 field を拡張して、マルチモodalな縦断的電子歴史記録(EHR)における長期的依存関係を捉えることを可能にする。5年後の心不全、糖尿病、CKD、および脳卒中のリスク予測において、平均して AUROC が 1%〜5%、AUPRC が 3%〜6% 向上し、特に長い医療歴を持つ患者においてはさらに顕著な向上を示す。
Electronic health records represent a holistic overview of patients' trajectories. Their increasing availability has fueled new hopes to leverage them and develop accurate risk prediction models for a wide range of diseases. Given the complex interrelationships of medical records and patient outcomes, deep learning models have shown clear merits in achieving this goal. However, a key limitation of these models remains their capacity in processing long sequences. Capturing the whole history of medical encounters is expected to lead to more accurate predictions, but the inclusion of records collected for decades and from multiple resources can inevitably exceed the receptive field of the existing deep learning architectures. This can result in missing crucial, long-term dependencies. To address this gap, we present Hi-BEHRT, a hierarchical Transformer-based model that can significantly expand the receptive field of Transformers and extract associations from much longer sequences. Using a multimodal large-scale linked longitudinal electronic health records, the Hi-BEHRT exceeds the state-of-the-art BEHRT 1% to 5% for area under the receiver operating characteristic (AUROC) curve and 3% to 6% for area under the precision recall (AUPRC) curve on average, and 3% to 6% (AUROC) and 3% to 11% (AUPRC) for patients with long medical history for 5-year heart failure, diabetes, chronic kidney disease, and stroke risk prediction. Additionally, because pretraining for hierarchical Transformer is not well-established, we provide an effective end-to-end contrastive pre-training strategy for Hi-BEHRT using EHR, improving its transferability on predicting clinical events with relatively small training dataset.
研究の動機と目的
- 標準的なディープラーニングモデルが縦断的 EHR データの長い系列を処理する能力に制限があることに対処する。
- 標準的なトランスフォーマーの受容 field が制限されていることによる、長期的医療的依存関係の捉えにくさを克服する。
- 数十年にわたる患者の歴史を用いて、心不全、糖尿病、慢性腎臓病、脳卒病などの臨床的イベントを正確に予測することを可能にする。
- 小規模な下流データセットにおける転移可能性を向上させるために、階層的トランスフォーマー向けの効果的なエンドツーエンドの対照的事前学習戦略を開発する。
- 長期的パターンが予測に最も重要となる、広範な医療歴を持つ患者におけるモデル性能を向上させる。
提案手法
- 複数の粒度レベルで EHR シーケンスを処理できる階層的アテンション機構を提案し、より長い有効なコンテキスト窓を実現する。
- 2段階のトランスフォーマー構造を採用:ローカルエンコーダーが個々の訪問を処理し、グローバルエンコーダーが訪問レベルの表現を統合する。
- 臨床予測タスクの微調整の前に意味のある表現を学習するために、EHR データを用いたエンドツーエンドの対照的事前学習目的を導入する。
- 診断、薬剤、検査、手術などのマルチモーダル EHR データを統合し、統一された埋め込み空間に統合する。
- 相対的位置符号化を用いたマスキング自己注意機構を活用し、長い系列における時間的順序と関係性を保持する。
- クラスバランスの取れたサンプリングを用いたバイナリクロスエントロピー損失により、下流の臨床イベント予測タスクで事前学習モデルを微調整する。
実験結果
リサーチクエスチョン
- RQ1階層的トランスフォーマーのアーキテクチャは、標準的なトランスフォーマーの受容 field を拡張し、数十年にわたる EHR シーケンスをモデル化するために効果的か?
- RQ2心不全、糖尿病、CKD、脳卒中など複数の疾患における 5 年後の臨床的イベント予測において、BEHRT や他の SOTA モデルと比較して Hi-BEHRT はどのように性能を発揮するか?
- RQ3提案された対照的事前学習戦略は、限定的なラベル付き EHR データにおけるモデルの一般化性能をどの程度向上させるか?
- RQ4長期間の医療歴を持つ患者に対して、Hi-BEHRT は短い歴史の患者と比較して顕著な性能向上を示すか?
- RQ5標準モデルが見逃す臨床的に重要な長期的依存関係を、モデルは捉えられるか?
主な発見
- 心不全、糖尿病、慢性腎臓病、脳卒中の 5 年後のリスク予測において、Hi-BEHRT は前回の SOTA モデル BEHRT より平均して AUROC が 1%〜5%、AUPRC が 3%〜6% 向上した。
- 長期間の医療歴を持つ患者では、AUROC が 3%〜6% 向上し、AUPRC は最大 11% 向上し、長期的依存関係の捉えが強化されたことを示している。
- エンドツーエンドの対照的事前学習戦略は、モデルの転移可能性を顕著に向上させ、比較的小さな下流学習データセットでも高い性能を発揮できるようにした。
- 階層的設計により、複数の医療モダリティにわたる複雑な時間的パターンを効果的に捉えられ、非階層的対応モデルを上回る性能を示した。
- 多様な臨床的状態においてもモデルの性能が安定しており、多様な慢性疾患予測タスクへの一般化可能性を示している。
- アブレーションスタディにより、階層的アーキテクチャと対照的事前学習の両方が性能向上に不可欠であることが確認され、各コンポonent が最終的な結果に顕著な貢献をしていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。