Skip to main content
QUICK REVIEW

[論文レビュー] EVA: Generating Longitudinal Electronic Health Records Using Conditional Variational Autoencoders

Siddharth Biswal, Soumya Ghosh|arXiv (Cornell University)|Dec 18, 2020
Machine Learning in Healthcare参考文献 30被引用数 9
ひとこと要約

EVAは、時間的パターンと患者レベルのばらつきを保持しながら離散的臨床訪問系列をモデル化することで、現実的で多様な縦断的電子歴史記録(EHR)を生成するための条件付き変分オートエンコーダーを提案する。確率的勾配マルコフ連鎖モンテカルロとアンモトライズド変分推論を組み合わせることで、効率的かつ正確な事後分布推論を実現し、下流の予測モデリングタスクおよびユーザー評価において実データと一致する最先端の性能を達成した。

ABSTRACT

Researchers require timely access to real-world longitudinal electronic health records (EHR) to develop, test, validate, and implement machine learning solutions that improve the quality and efficiency of healthcare. In contrast, health systems value deeply patient privacy and data security. De-identified EHRs do not adequately address the needs of health systems, as de-identified data are susceptible to re-identification and its volume is also limited. Synthetic EHRs offer a potential solution. In this paper, we propose EHR Variational Autoencoder (EVA) for synthesizing sequences of discrete EHR encounters (e.g., clinical visits) and encounter features (e.g., diagnoses, medications, procedures). We illustrate that EVA can produce realistic EHR sequences, account for individual differences among patients, and can be conditioned on specific disease conditions, thus enabling disease-specific studies. We design efficient, accurate inference algorithms by combining stochastic gradient Markov Chain Monte Carlo with amortized variational inference. We assess the utility of the methods on large real-world EHR repositories containing over 250, 000 patients. Our experiments, which include user studies with knowledgeable clinicians, indicate the generated EHR sequences are realistic. We confirmed the performance of predictive models trained on the synthetic data are similar with those trained on real EHRs. Additionally, our findings indicate that augmenting real data with synthetic EHRs results in the best predictive performance - improving the best baseline by as much as 8% in top-20 recall.

研究の動機と目的

  • 医療システムにおけるデータプライバシーの必要性と研究者が現実世界の縦断的EHRデータにアクセスする必要性の間にある重要な矛盾を解決すること。
  • 現実的な時間的パターン、患者レベルの多様性、臨床的シーケンスの複雑さを保持する合成EHRを生成すること。
  • 特定の疾患状態を条件としてEHRを生成できるようにし、標的臨床研究を支援すること。
  • 大規模なEHR合成に適した精度とスケーラビリティのバランスを取った効率的な推論アルゴリズムを開発すること。
  • 臨床医によるユーザー調査および予測モデリングタスクを通じて、合成EHRの現実性と実用性を検証すること。

提案手法

  • EVAは、各訪問が臨床コードのバイナリーベクトルとして表現される離散的EHRイベント系列をモデル化するため、条件付き変分オートエンコーダー(CVAE)を採用する。
  • 患者レベルの疾患状態を条件として生成に用いることで、疾患特異的な合成EHRの生成を可能にする。
  • 潜在変数の事後分布推論を効率的に行うために、確率的勾配マルコフ連鎖モンテカルロ(SGMCMC)とアンモトライズド変分推論を統合する。
  • VAEフレームワーク内での再帰的または逐次的モデリングコンponentsを用いて、EHR系列内の時間的依存性を捉える。
  • 潜在的な不確実性を保持することで、モード崩壊を回避し、生成シーケンスの多様性を確保し、現実性を向上させる。
  • 一般化と忠実度を確保するため、25万件を超える患者と1300万件以上の訪問を含む大規模な実EHRリポジトリでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、現実世界の臨床パターンを反映する現実的で多様な合成EHRシーケンスを生成できるか?
  • RQ2モデルは特定の疾患状態を条件としてEHRをどの程度正確に生成できるか。これにより、標的臨床研究が可能になるか?
  • RQ3合成EHRデータは、医療分野における効果的な予測モデルの訓練を支えるのに十分な忠実度を保持しているか?
  • RQ4合成EHRで訓練されたモデルの性能は、実データで訓練されたモデルと比較して、再現率と適合率の観点でどの程度の差があるか?
  • RQ5合成EHRを用いて実データを拡張することで、実データのみで達成可能な性能を超える予測性能の向上が可能になるか?

主な発見

  • ユーザー調査において、実務経験のある臨床医がEVAが生成したEHRシーケンスを現実的と評価し、臨床的妥当性が確認された。
  • 実EHRで訓練されたモデルと同等の性能を示す予測モデルが、合成EHRで訓練されたことで実証され、データ忠実度が裏付けられた。
  • 実EHRデータに合成データを追加することで、最良のベースラインモデルと比較してトップ20再現率が最大8%向上した。
  • モデルは存在漏洩攻撃に対して頑健であり、感度と適合率が80%の事前確率未満に抑えられ、再識別リスクがないことが示された。
  • LSTMベースラインと比較して、EVAはより多様な臨床イベントシーケンスを生成し、訪問間の繰り返しを低減させ、現実性を向上させた。
  • 実EHRと合成EHRの組み合わせデータが、どちらか一方のデータ源で訓練されたモデルよりも予測性能が優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。