Skip to main content
QUICK REVIEW

[論文レビュー] Development of Interpretable Machine Learning Models to Detect Arrhythmia based on ECG Data

Shourya Verma|arXiv (Cornell University)|May 5, 2022
ECG Monitoring and Analysis被引用数 6
ひとこと要約

本稿では、MIT-BIH心室性心拍動データセットからの心電図(ECG)データを用いて、解釈可能な深層学習モデル(CNNおよびLSTM)を開発し、高い正確性で心室性不整脈を検出する。複数の解釈可能性技術を評価した結果、局所的解釈性において勾配加重クラス活性化マッピング(Grad-CAM)が最も効果的であり、分類意思決定の主要な特徴としてQRS複合波を一貫して強調していた。

ABSTRACT

The analysis of electrocardiogram (ECG) signals can be time consuming as it is performed manually by cardiologists. Therefore, automation through machine learning (ML) classification is being increasingly proposed which would allow ML models to learn the features of a heartbeat and detect abnormalities. The lack of interpretability hinders the application of Deep Learning in healthcare. Through interpretability of these models, we would understand how a machine learning algorithm makes its decisions and what patterns are being followed for classification. This thesis builds Convolutional Neural Network (CNN) and Long Short-Term Memory (LSTM) classifiers based on state-of-the-art models and compares their performance and interpretability to shallow classifiers. Here, both global and local interpretability methods are exploited to understand the interaction between dependent and independent variables across the entire dataset and to examine model decisions in each sample, respectively. Partial Dependence Plots, Shapley Additive Explanations, Permutation Feature Importance, and Gradient Weighted Class Activation Maps (Grad-Cam) are the four interpretability techniques implemented on time-series ML models classifying ECG rhythms. In particular, we exploit Grad-Cam, which is a local interpretability technique and examine whether its interpretability varies between correctly and incorrectly classified ECG beats within each class. Furthermore, the classifiers are evaluated using K-Fold cross-validation and Leave Groups Out techniques, and we use non-parametric statistical testing to examine whether differences are significant. It was found that Grad-CAM was the most effective interpretability technique at explaining predictions of proposed CNN and LSTM models. We concluded that all high performing classifiers looked at the QRS complex of the ECG rhythm when making predictions.

研究の動機と目的

  • ECGデータを用いた不整脈検出のための高精度で解釈可能な機械学習モデルの開発。
  • 「ブラックボックス」型の深層学習モデルの臨床的限界を解消するため、グローバルおよびローカルの解釈可能性技術を統合。
  • 時系列ECGデータに対する解釈可能性手法(PDP、SHAP、PFI、Grad-CAM)の有効性を評価・比較。
  • K-FoldおよびLeave Groups Out交差検証を用いてモデル性能を検証し、非パラメトリック統計的検定を実施。
  • モデルの意思決定が心電図の形態に関する既存の医学的知識と整合することを確認することで、臨床的妥当性を確保。

提案手法

  • MIT-BIH心室性心拍動データセットの単一誘導ECGビートを用いて、畳み込みニューラルネットワーク(CNN)および長短期記憶(LSTM)モデルを訓練。
  • 次元削減と解釈可能性ツールの互換性向上を目的に、ECGビートを11個の時間的ウィンドウに分割して前処理。
  • 4つの解釈可能性技術を適用:部分従属プロット(PDP)、シャープリー加法的解釈(SHAP)、順列特徴重要度(PFI)、勾配加重クラス活性化マッピング(Grad-CAM)。
  • 被験者間での汎化性能を評価するため、K-Fold交差検証およびLeave Groups Out評価を実施。
  • モデル間の性能差を検証するため、非パラメトリック統計的検定(例:Wilcoxon符号順位検定)を実施。
  • ECGビートごとのモデル注目度を分析し、正しく分類された予測と誤って分類された予測を比較するため、Grad-CAMのヒートマップを可視化。

実験結果

リサーチクエスチョン

  • RQ1CNN、LSTM、または浅い分類器の中で、どの機械学習モデルがMIT-BIHデータセットからのECGビート分類において最高の正確性を達成するか?
  • RQ2グローバルな解釈可能性手法(PDP、SHAP、PFI)とローカルな手法(Grad-CAM)の両方が、時系列ECGデータのモデル予測を説明する上でどの程度有効か?
  • RQ3各不整脈クラス内において、正しく分類されたECGビートと誤って分類されたECGビートの間で、Grad-CAMの局所化に差異があるか?
  • RQ4医学的知識に従って、モデルが分類意思決定のためにQRS複合波にどの程度依存しているか?
  • RQ5Grad-CAM や PFI といった解釈可能性技術が、異なるモデルやデータ分割において一貫した臨床的意味を持つパターンを明らかにできるか?

主な発見

  • CNNおよびLSTMモデルは、K-Fold交差検証で94.1%および94.0%の正確性を達成し、Leave Groups Out検証では98.7%および97.0%の正確性を示した。
  • Grad-CAMが最も効果的な解釈可能性手法であった。明確で局所的な注目度マップを提供し、一貫してQRS複合波を主な意思決定特徴として強調した。
  • 高性能なすべてのモデルがQRS複合波に注目しており、不整脈診断の臨床的理解と整合していることを確認した。
  • PFIは特徴重要度のグローバルでモデルに依存しない洞察を提供したが、個々のサンプルやクラスの解釈性に欠け、個々のビート分析には限界があった。
  • SHAPは高い計算コスト、PDPは情報量が乏しく、特に高時間分解能を持つ時系列データでは有効でなかった。
  • 本研究では、解釈可能性技術がECG分類における深層学習モデルの透明性を高め、信頼性と臨床的適用性を向上させられることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。