[論文レビュー] Prediction of future hospital admissions - what is the tradeoff between specificity and accuracy?
本論文は、電子的医療記録(EHR)を用いて将来の入院を予測する機械学習モデルの評価を行い、予測の特異性と正確性のトレードオフに注目している。モデルは、入院タイプの98%をカバーする場合でもAUCがたった0.8%低下するにとどまり、高いスケーラビリティと実世界への展開における実用的妥当性を示している。
Large amounts of electronic medical records collected by hospitals across the developed world offer unprecedented possibilities for knowledge discovery using computer based data mining and machine learning. Notwithstanding significant research efforts, the use of this data in the prediction of disease development has largely been disappointing. In this paper we examine in detail a recently proposed method which has in preliminary experiments demonstrated highly promising results on real-world data. We scrutinize the authors' claims that the proposed model is scalable and investigate whether the tradeoff between prediction specificity (i.e. the ability of the model to predict a wide number of different ailments) and accuracy (i.e. the ability of the model to make the correct prediction) is practically viable. Our experiments conducted on a data corpus of nearly 3,000,000 admissions support the authors' expectations and demonstrate that the high prediction accuracy is maintained well even when the number of admission types explicitly included in the model is increased to account for 98% of all admissions in the corpus. Thus several promising directions for future work are highlighted.
研究の動機と目的
- 最近提案された入院予測のための機械学習モデルが、明示的にモデル化する入院タイプの数が増加するにつれて、高い正確性を維持するかどうかを評価すること。
- 実世界の電子的健康記録(EHR)データにおいて、モデルの特異性(予測する疾患数)と予測正確性のトレードオフを調査すること。
- 実世界のコーパスにおける全入院の大部分をカバーするように拡張した場合でも、モデルの性能が安定的かつ信頼性があるままであるかどうかを特定すること。
- モデルの予測能力が、さまざまな疾患タイプに均等に分布しているのか、それとも頻度の高い疾患に偏っているのかを評価すること。
- より詳細な分類、時間的要因の統合、および重要な入院タイプの選定基準の代替案を用いた、モデルの臨床的有用性を向上させる実用的方策を同定すること。
提案手法
- 患者の過去の入院履歴を、ICD-10分類システムに由来する診断関連グループ(DRG)コードに対応する要素を有する履歴ベクトル表現として使用する。
- 条件付きマルコフ連鎖モデル(CMC)を用いて、履歴ベクトル内の過去の入院の系列に基づき、将来の入院の確率を計算する。
- データセット内での頻度に基づき、重要なDRGコードを選定し、含まれるコード数を10から200に変化させることでスケーラビリティを評価する。
- 性能は、CMC曲線の下側面積(AUC)および正しい入院タイプの平均予測順位を用いて評価する。
- コーパス全体の入院の61%、91%、98%のカバレッジレベルで、モデルの性能を測定する。
- 予測順位のヒストグラムを分析し、性能低下が特定のDRGコードに集中しているか、それとも均等に分布しているかを評価する。
実験結果
リサーチクエスチョン
- RQ1元の30コードを上回る数の明示的にモデル化された入院タイプに拡張する際、モデルの予測正確性が著しく低下するか?
- RQ2全入院の98%をカバーする範囲で、特異性(予測する疾患数)と正確性のトレードオフが実用的に妥当であるか?
- RQ3性能低下が生じる場合、特定の疾患タイプに偏っているのか、それとも均等に分布しているのか?
- RQ4重要なDRGコードの数が増加するにつれて、正しい入院タイプの平均予測順位はどのように変化するか?
- RQ5より詳細なDRGコードを用いるか、入院履歴に時間的情報を組み込むことで、モデルは高い性能を維持できるか?
主な発見
- モデルは、コーパス全体の入院の98%をカバーするように明示的にモデル化されたDRGコードの数を増加させても、高い予測正確性を維持している。
- 61%から98%のカバレッジに移行する際、CMC曲線の下側面積(AUC)はわずか0.8%低下するため、性能低下は最小限に抑えられている。
- 正しい入院タイプの平均予測順位は、10個の重要なコードを用いた場合の約1.5から、200個の重要なコードを用いた場合の7.3に上昇しており、順位精度の低下は顕著ではあるが、壊滅的ではない。
- 性能低下は、異なるDRGコード間で均等に分布しており、患者の特定の疾患にかかわらず一貫した予測信頼性が保証されている。
- 頻度が低くても臨床的に重要な疾患を含めても、モデルの性能低下は小さく、一貫しているため、その感度は低い。
- 結果は、モデルが良好にスケーリングできることを裏付け、広範な疾患カバレッジを持つ実世界の臨床展開に実用的候補であると主張する著者らの主張を支持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。