Skip to main content
QUICK REVIEW

[論文レビュー] AI Framework for Early Diagnosis of Coronary Artery Disease: An Integration of Borderline SMOTE, Autoencoders and Convolutional Neural Networks Approach

Elham Nasarian, Danial Sharifrazi|arXiv (Cornell University)|Aug 29, 2023
Artificial Intelligence in Healthcare被引用数 4
ひとこと要約

本稿では、データバランスの取れた処理にBorderline SMOTEを統合し、特徴量学習およびデータ拡張にオートエンコーダーを、冠動脈疾患(CAD)の早期診断に9層の畳み込みニューラルネットワーク(CNN)を組み合わせた新しいAIフレームワークを提案する。本手法は、小規模で不均衡なCADデータセットにおいて95.36%の平均正答率を達成し、ランダムフォレスト、SVM、ANNといった従来の機械学習モデルを上回った。

ABSTRACT

The accuracy of coronary artery disease (CAD) diagnosis is dependent on a variety of factors, including demographic, symptom, and medical examination, ECG, and echocardiography data, among others. In this context, artificial intelligence (AI) can help clinicians identify high-risk patients early in the diagnostic process, by synthesizing information from multiple factors. To this aim, Machine Learning algorithms are used to classify patients based on their CAD disease risk. In this study, we contribute to this research filed by developing a methodology for balancing and augmenting data for more accurate prediction when the data is imbalanced and the sample size is small. The methodology can be used in a variety of other situations, particularly when data collection is expensive and the sample size is small. The experimental results revealed that the average accuracy of our proposed method for CAD prediction was 95.36, and was higher than random forest (RF), decision tree (DT), support vector machine (SVM), logistic regression (LR), and artificial neural network (ANN).

研究の動機と目的

  • 小規模でクラス不均衡が生じる冠動脈疾患(CAD)データセットにおける、早期診断の向上を図る挑戦に応えること。
  • データ拡張と特徴表現を活用して予測精度を向上させる、ハイブリッドな機械学習およびディープラーニングフレームワークの開発。
  • 限られたデータや不均衡なデータを扱う他の医療診断タスクに適用可能な、強固で一般化可能な手法の構築。
  • 心血管センターから得た詳細な臨床的および心電図(ECG)特徴量を有する実世界のCADデータセットを用いて、提案フレームワークの妥当性を検証すること。

提案手法

  • 決定境界を保持しつつ、少数クラス(CAD陽性)のサンプルを過剰採番するため、Borderline SMOTEを適用した。
  • 入力データの圧縮され意味のある表現を学習するため、57×1の入力とボトルネック層に32ニューロンを有する深層オートエンコーダーを用いた。
  • デコーダーを介して入力を再構築し、合成された高品質なトレーニングサンプルを生成することで、データセットサイズを303から826に増強した。
  • 4つの畳み込み層(各256フィルタ、ReLU活性化関数)と5つの全結合層(256、128、64、32、2ニューロン)を有する9層のCNNを採用し、L2正則化とドロップアウト(0.5)を適用して過学習を防止した。
  • モデル性能の堅牢で偏りのない評価を確保するため、10分割交差検証を実施した。
  • GPU環境で、学習率0.001、バッチサイズ256、100エポックで、Adam最適化アルゴリズムを用いてCNNをトレーニングした。

実験結果

リサーチクエスチョン

  • RQ1Borderline SMOTE、オートエンコーダー、CNNの統合は、古典的機械学習モデルと比較して、小規模で不均衡なCADデータセットにおける分類精度を向上させることができるか?
  • RQ2オートエンコーダーを用いたデータ拡張戦略は、臨床的妥当性を保持しつつ、トレーニングサンプル数を増加させるのにどの程度有効であったか?
  • RQ3提案されたディープラーニングアーキテクチャは、SVM、ランダムフォレスト、ANNといった従来の分類器と比較して、CAD診断においてどの程度優れているか?
  • RQ4クラス不均衡なデータ処理技術の使用は、早期CAD検出における誤分類率を顕著に低減するか?

主な発見

  • 提案フレームワークは10分割交差検証において平均正答率95.36%を達成し、すべてのベースラインモデルを顕著に上回った。
  • 再現率95.00%、適合率94.80%、F1スコア95.05%、ROC AUC 95.06%を達成し、優れた一般化性能と頑健性を示した。
  • 比較対象モデルの中でランダムフォレストが2番目に高い正答率(94.77%)を記録し、次いでSVM(94.66%)が続いたが、ロジスティック回帰とANNは低い性能を示した。
  • オートエンコーダーを用いたデータ拡張は、ノイズや関連性のない合成サンプルを導入することなく、モデルの一般化性能を効果的に向上させた。
  • ドロップアウトとL2正則化を組み合わせたCNNアーキテクチャは、小規模なデータセットにもかかわらず、過学習に対して強く耐性を示した。
  • フレームワークの性能は全10分割で安定しており、一貫した正答率とF1スコアを示した。これにより、信頼性と再現可能性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。