Skip to main content
QUICK REVIEW

[論文レビュー] Disease phenotyping using deep learning: A diabetes case study

Sina Rashidian, Janos Hajagos|arXiv (Cornell University)|Nov 28, 2018
Machine Learning in Healthcare参考文献 10被引用数 4
ひとこと要約

本研究では、電子的健康記録(EHR)データを用いた糖尿病の表現型同定を改善するために、臨床コーダーの意思決定を模倣する深層学習モデルを提案する。年齢・性別などの人口統計学的特徴、検査結果、薬剤情報、および以前の診断コードを活用する。モデルはICDコードの予測において高い正確性を示し、9.07%の糖尿病症例でコードが誤って記録されているか、欠落していることが判明した。専門家によるレビューでは、高信頼度の不一致ケースにおいてモデルがコーダーを上回ることが確認された。

ABSTRACT

Characterization of a patient clinical phenotype is central to biomedical informatics. ICD codes, assigned to inpatient encounters by coders, is important for population health and cohort discovery when clinical information is limited. While ICD codes are assigned to patients by professionals trained and certified in coding there is substantial variability in coding. We present a methodology that uses deep learning methods to model coder decision making and that predicts ICD codes. Our approach predicts codes based on demographics, lab results, and medications, as well as codes from previous encounters. We are able to predict existing codes with high accuracy for all three of the test cases we investigated: diabetes, acute renal failure, and chronic kidney disease. We employed a panel of clinicians, in a blinded manner, to assess ground truth and compared the predictions of coders, model and clinicians. When disparities between the model prediction and coder assigned codes were reviewed, our model outperformed coder assigned ICD codes.

研究の動機と目的

  • ICDコードにおける糖尿病の不正確さを解消するため、深層学習を用いてコーダーの意思決定をモデル化すること。
  • 疾患固有の特徴工学を必要としない、一般化可能なデータ駆動型の疾患表現型同定手法を開発すること。
  • 不一致ケースにおける専門医のレビューと比較して、モデルの性能を評価し、正確性と信頼性を検証すること。
  • モデルの予測と専門家による検証を用いて、EHRにおける糖尿病の世界的な誤コード化率を推定すること。
  • 複数の医療機関にまたがるスケーラビリティと一般化可能性を、モデルが有するかを検証すること。

提案手法

  • 多層パーセプトロンの深層ニューラルネットワークを、OHDSI共通データモデルにマッピングされた匿名化されたEHRデータ上で学習させた。人口統計学的特徴、検査結果、薬剤情報、および以前の診断コード特徴を用いた。
  • 次元削減のため、陽性糖尿病症例の少なくとも5%に存在する特徴に限定した。これにより、次元数は13,139から966に削減され、スパarsityが低減された。
  • 以前の診断コードを、歴史的疾患負荷を表すバイナリーベクトルに集約し、RNNを必要とせずに時間的パターンを学習可能にした。
  • モデル出力にはシグモイド活性化関数を用い、糖尿病の可能性を示す確率スコア(p)を出力した。このスコアは、信頼度レベルごとに不一致ケースを階層化するのに用いられた。
  • 専門医が二重盲検で120件の不一致ケースをレビューし、診断の有無と自身の信頼度を評価した。
  • 一般化可能性を評価するため、11施設のデータでモデルを再学習し、各施設の独立したテストセットで性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1標準的なEHRデータ要素を用いて、深層学習モデルが糖尿病のICDコード決定を正確に再現できるか?
  • RQ2モデルの予測信頼度は、専門医が臨床的におそらく糖尿病であると判断する可能性とどの程度相関するか?
  • RQ3現実のEHRデータにおいて、糖尿病コードの誤りはどの程度存在するか。また、欠落と誤って記録されたコードにどのように分解されるか?
  • RQ4複数施設のデータで学習した単一の深層学習モデルは、異なる医療機関にまたがって効果的に一般化できるか?
  • RQ5モデルとコーダーの不一致が、専門家レビューによって検証された実際のコーディング誤りをどれほど反映しているか?

主な発見

  • 単一施設のデータで学習およびテストした場合、モデルはF1スコア0.80を達成し、糖尿病ICDコードの予測において優れた性能を示した。
  • 高信頼度の不一致ケースでは、120件の専門家レビューのうち35件がモデルの判断に一致した。これは、モデルが高信頼度である場合、コーダーが間違う可能性が著しく高いことを示している。
  • モデルは、全症例の9.07%で糖尿病コードが誤って記録されているか、欠落していると予測した。そのうち5.68%が欠落、3.39%が誤って記録されたものであった。
  • モデルが予測した糖尿病の確率は、専門医が確定した疾患の可能性と密接に一致し、信頼区間全体で良好なキャリブレーションが確認された。
  • 11施設のデータで学習した場合、施設143でF1スコア0.79を達成し、施設固有のバイアス要因に対しても強い一般化性と耐性を示した。
  • 専門家レビューにより、モデルの信頼度スコアが各不一致グループにおける糖尿病の真の有病率を正確に反映していることが確認され、信頼性の高い不確実性推定が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。