[論文レビュー] Deep Representation for Patient Visits from Electronic Health Records
本論文では、自由記述ノートと構造化データを含む生の電子的健康記録(EHR)データから、患者の訪問を低次元で臨床的に意味のある埋め込み表現として学習する教師あり深層学習手法を提案する。神経ネットワークを用いてICD-9診断チャプターを予測させることで、このタスクを自己教師付きの代理タスクとして用いる。得られた埋め込み表現は関連する医学的意味を捉えており、下流の予測タスク(例:ICDコーディング)の性能を向上させるとともに、埋め込み空間内での解釈可能な臨床的方向性を明らかにし、再訓練を伴わずに複数の臨床的タスクに再利用可能である。
We show how to learn low-dimensional representations (embeddings) of patient visits from the corresponding electronic health record (EHR) where International Classification of Diseases (ICD) diagnosis codes are removed. We expect that these embeddings will be useful for the construction of predictive statistical models anticipated to drive personalized medicine and improve healthcare quality. These embeddings are learned using a deep neural network trained to predict ICD diagnosis categories. We show that our embeddings capture relevant clinical informations and can be used directly as input to standard machine learning algorithms like multi-output classifiers for ICD code prediction. We also show that important medical informations correspond to particular directions in our embedding space.
研究の動機と目的
- 生のEHRデータ(構造化データと自由記述ノートの両方を含む)を用いて、一般化可能で低次元の患者訪問表現を構築すること。
- 手動による特徴工学を伴わずに、臨床的に関連する埋め込み表現を学習するため、ICDコード予測を自己教師付きタスクとして活用すること。
- 学習された埋め込み表現が医学的意味を保持しており、下流の予測タスクでの性能を向上させることを実証すること。
- 同様の埋め込み表現を、コhort選択や疾患予測などの多様な臨床的応用に再利用可能とすることで、以降のモデルの計算コストを低減すること。
- 埋め込み空間内のベクトル方向に特定の医学的概念(例:敗血症、抗生物質耐性)が方向的パターンとして特定可能であることを示し、解釈可能性を提供すること。
提案手法
- 生のEHR入力を用いて、ICD-9診断チャプター(19の広範なカテゴリ)を予測する深層ニューラルネットワークを訓練し、このタスクを意味のある表現を学習するための代理タスクとして用いる。
- モデルの入力は、カイ二乗検定による特徴選択で40,000から8,000に削減された構造化EHRデータと、2,000語に制限された自由記述臨床ノートの両方である。
- ネットワークアーキテクチャには、ReLU活性化関数を用いた全結合層を含み、最終的なエンコーダ層がℝ⁴⁴⁸内に448次元の埋め込みベクトルを出力する。
- 訓練目的は19のICD-9チャプターに対する多値分類交差エントロピー損失であり、診断にわたる一般化を可能にする共有表現を学習可能である。
- 特徴選択はカイ二乗検定を自動で用いることで実施され、表現学習プロセスに専門家の干渉を一切排除する。
- 埋め込みの解釈可能性は、既知の臨床的概念(例:敗血症ショック、自己免疫性合併症)と埋め込み空間内のベクトル方向との間の共線形性分析を用いて評価する。
実験結果
リサーチクエスチョン
- RQ1生のEHRデータから手動による特徴工学を伴わず、低次元で臨床的に意味のある患者訪問表現を深層ニューラルネットワークが直接学習できるか?
- RQ2ICD-9診断チャプターの予測を自己教師付きタスクとして用いることで、関連する医学的意味を捉え、下流の予測性能を向上させる埋め込み表現が得られるか?
- RQ3特定の臨床的概念(例:敗血症、抗生物質耐性)が、学習された埋め込み空間内で解釈可能な方向としてエンコードされているか?
- RQ4同じ事前に計算された埋め込み表現が、複数の下流タスクに効果的に再利用可能か?
- RQ5生のEHR特徴を直接標準機械学習モデルに用いる場合と比較して、埋め込み表現の品質はどのように異なるか?
主な発見
- 学習された448次元の埋め込み表現は、生のEHR特徴を直接用いる場合と比較して、ランダムフォレスト分類器のICDコード予測性能を顕著に向上させた。
- 共線形性分析により、入力特徴に明示的に記録されていなかったにもかかわらず、敗血症性ショックや心原性ショックといった複雑な臨床的概念が埋め込み表現に捉えられていることが示された。
- 構造化EHRデータに存在しなかった自己免疫性合併症までもが、埋め込み空間で回復可能であったため、データの欠損に対して高い耐性を示していることがわかった。
- モデルは19の広範なICD-9チャプター内に、より細分化された診断的概念を効果的に整理しており、クラスの不均衡が存在する中でも、洗練された臨床的意味を表現していることが示された。
- 埋め込み空間には、重要な医学的概念に対応する解釈可能な方向性が明らかにされており、臨床的妥当性と解釈可能性が裏付けられた。
- 事前に埋め込みを計算することで、複数の下流タスクへの効率的な再利用が可能となり、以降のモデルの計算コストが削減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。