Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Training for Disease Prediction from Electronic Health Records with Missing Data

Uiwon Hwang, Sung‐Woon Choi|arXiv (Cornell University)|Nov 11, 2017
Machine Learning in Healthcare参考文献 40被引用数 15
ひとこと要約

本論文は、欠損データを伴う電子歴史記録(EHRs)からの疾患予測のための2段階フレームワークを提案する。欠損値の補完にはスタックドオートエンコーダーを、疾患分類には補助分類器GAN(AC-GAN)を用いる。このアプローチは、従来の手法と比較して欠損データやクラス不均衡に対して優れた耐性を示し、97.77%の精度、98.89%のAUC-ROC、96.88%のFスコアを達成し、最先端の性能を実現した。

ABSTRACT

Electronic health records (EHRs) have contributed to the computerization of patient records and can thus be used not only for efficient and systematic medical services, but also for research on biomedical data science. However, there are many missing values in EHRs when provided in matrix form, which is an important issue in many biomedical EHR applications. In this paper, we propose a two-stage framework that includes missing data imputation and disease prediction to address the missing data problem in EHRs. We compared the disease prediction performance of generative adversarial networks (GANs) and conventional learning algorithms in combination with missing data prediction methods. As a result, we obtained a level of accuracy of 0.9777, sensitivity of 0.9521, specificity of 0.9925, area under the receiver operating characteristic curve (AUC-ROC) of 0.9889, and F-score of 0.9688 with a stacked autoencoder as the missing data prediction method and an auxiliary classifier GAN (AC-GAN) as the disease prediction method. The comparison results show that a combination of a stacked autoencoder and an AC-GAN significantly outperforms other existing approaches. Our results suggest that the proposed framework is more robust for disease prediction from EHRs with missing data.

研究の動機と目的

  • 実臨床現場における正確な疾患予測を阻害する電子歴史記録(EHRs)における欠損データの課題に対処すること。
  • 過剰サンプリング技術に依存せずに、欠損データとクラス不均衡の両方を処理できる耐性のある疾患予測フレームワークの開発。
  • 生成的対抗ネットワーク(GANs)、特にAC-GANsが、深層学習ベースの補完手法と組み合わせた場合に、疾患予測に与える影響を評価すること。
  • 本フレームワークを、平均補完や多層パーセプトロンといった従来の補完および分類手法と比較すること。
  • 敵対的訓練が、スパarsely分布し不均衡なデータを有するEHRsにおいて、疾患予測性能を向上させうるかどうかを調査すること。

提案手法

  • 2段階のフレームワークを提案:まず、スタックドオートエンコーダー(データの低次元表現を学習する深層教師なし学習モデル)を用いてEHRsの欠損値を補完する。
  • 補完されたEHRデータを入力として用い、補助分類器GAN(AC-GAN)を訓練する。AC-GANは、現実的なEHRサンプルの生成と疾患状態の分類を同時に学習する。
  • AC-GANの識別器は、実際のEHRサンプルと生成されたEHRサンプルを区別するとともに、正しい疾患クラスを予測するように訓練され、クラスの監視のもとでエンドツーエンドの敵対的訓練が可能になる。
  • スタックドオートエンコーダーは、しきい値(例:0.1)を超えるスパarsityを持つEHRデータ上で訓練され、入力と再構成されたデータの差を最小化する再構成損失が使用される。
  • 最適な訓練エポック数の決定のため、検証データを用いたモデル選択が行われ、最小の検証誤差に基づく。
  • 過剰サンプリング技術を避けるために、生成器が少数クラスの実際のサンプルを合成できる能力を活用し、メモリの増加を伴わずにクラス不均衡を緩和する。

実験結果

リサーチクエスチョン

  • RQ1スパarsityが著しいEHRsにおいて、スタックドオートエンコーダーは、平均補完やゼロ補完といった単純な補完手法を上回る性能で欠損値を補完できるか?
  • RQ2AC-GANによる敵対的訓練と深層補完を組み合わせることで、多層パーセプトロンのような従来モデルと比較して、疾患予測性能が向上するか?
  • RQ3本フレームワークは、EHRsにおける欠損データとクラス不均衡の両方を処理する際、精度、感度、特異度、AUC-ROC、Fスコアの観点でどの程度の性能を示すか?
  • RQ4GANの生成器が、t-SNE可視化によって実データと区別がつかないような高品質なEHRサンプルを生成できるか?
  • RQ5敵対的訓練を用いることで、明示的な過剰サンプリングを伴わずしてクラス分布を内蔵的にバランスさせることができ、メモリおよび計算コストを削減できるか?

主な発見

  • スタックドオートエンコーダーによる補完とAC-GANによる疾患分類の組み合わせが、最高の性能を示し、97.77%の精度を達成した。
  • 感度は95.21%、特異度は99.25%に達し、強力な識別能力を示した。
  • Fスコアは96.88%に達し、陽性および陰性の疾患クラスにおける適合率と再現率の両立が図れた。
  • t-SNE可視化により、生成されたEHRサンプルが実データとほとんど区別がつかないことが確認され、高品質なデータ合成が実現した。
  • 同じアーキテクチャを有する標準的な多層パーセプトロンよりもAC-GANが優れた性能を示し、敵対的訓練が予測性能を顕著に向上させたことが示された。
  • 過剰サンプリングを用いないにもかかわらず、クラス不均衡に対して耐性を示し、メモリおよび学習時間の増加を回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。