Skip to main content
QUICK REVIEW

[論文レビュー] Analysis of a Deep Learning Model for 12-Lead ECG Classification Reveals Learned Features Similar to Diagnostic Criteria

Theresa Bender, Jacqueline Michelle Beinecke|arXiv (Cornell University)|Nov 3, 2022
ECG Monitoring and Analysis被引用数 8
ひとこと要約

本研究では、事前に学習された深層ニューラルネットワークに解釈可能なAI(XAI)手法—統合勾配法とレイヤーごとの関連度プロパゲーション—を適用し、12誘導心電図分類において、モデルが臨床的診断基準と整合する特徴を学習していることを明らかにした。主な発見として、関連度スコアが教科書の知識と一致していることが示された:心房細動(AF)ではP波が明著に見えると負のスコアとなり、左束支部ブロック(LBBB)ではT波がQRS波と一致する(同一方向)と負のスコアとなる。また、LBBBの検出においては異常なQRS波形が主要な特徴となる。

ABSTRACT

Despite their remarkable performance, deep neural networks remain unadopted in clinical practice, which is considered to be partially due to their lack in explainability. In this work, we apply attribution methods to a pre-trained deep neural network (DNN) for 12-lead electrocardiography classification to open this "black box" and understand the relationship between model prediction and learned features. We classify data from a public data set and the attribution methods assign a "relevance score" to each sample of the classified signals. This allows analyzing what the network learned during training, for which we propose quantitative methods: average relevance scores over a) classes, b) leads, and c) average beats. The analyses of relevance scores for atrial fibrillation (AF) and left bundle branch block (LBBB) compared to healthy controls show that their mean values a) increase with higher classification probability and correspond to false classifications when around zero, and b) correspond to clinical recommendations regarding which lead to consider. Furthermore, c) visible P-waves and concordant T-waves result in clearly negative relevance scores in AF and LBBB classification, respectively. In summary, our analysis suggests that the DNN learned features similar to cardiology textbook knowledge.

研究の動機と目的

  • 深層学習の心電図解析への臨床的応用を妨げる障壁を克服するため、モデルの説明可能性を向上させること。
  • 深層ニューラルネットワーク(DNN)が、確立された循環器学的診断基準と整合する特徴を学習しているかどうかを調査すること。
  • クラス、誘導、心拍ごとの関連度スコアを分析するための定量的手法を構築および検証すること。
  • CPSC 2018およびPTB-XLの2つの公的心電図データベース間でモデルの挙動を比較し、耐性を評価すること。
  • アーティファクトがモデルの予測および関連度付与に与える影響を評価すること。

提案手法

  • 12誘導心電図信号の各サンプルに対して、関連度スコアを割り当てるために統合勾長法(IG)およびレイヤーごとの関連度プロパゲーション(LRP)を適用した。
  • CPSC 2018およびPTB-XLデータベースにおける27クラスの心電図分類を目的とした、Ribeiroらが開発した事前学習済みDNNを用いた。
  • 平均関連度をクラスごと、誘導ごと、平均心拍ごとに算出する3つの定量的分析フレームワークを提案した。
  • 関連度スコアをヒートマップおよび時系列オーバーレイとして可視化し、臨床的心電図パターンと照合した。
  • 心臓専門医による検証を行い、データベースおよびXAI手法間での結果を比較した。
  • アーティファクトおよび関連度スコアの時間的パターンに対するアブレーションスタディを実施した。

実験結果

リサーチクエスチョン

  • RQ112誘導心電図分類用のDNNが学習する特徴は、確立された臨床的診断基準と一致しているか?
  • RQ2心電図異常(例:AF、LBBB)および異なる誘導ごとに、関連度スコアはどのように変化するか?
  • RQ3関連度スコアの定量的分析により、モデルが形態的特徴か時間的特徴に依存しているかを特定できるか?
  • RQ4患者集団およびラベル付けの異なる複数の心電図データベース間で、モデルの説明はどの程度耐性を示すか?
  • RQ5アーティファクトがモデルの注目メカニズムを歪め、誤分類を引き起こす程度はどの程度か?

主な発見

  • 心房細動(AF)の関連度スコアは、P波が明確に観察可能な場合に上昇し、モデルがP波の欠如または異常を診断的マーカーとして扱っていることを示している。
  • 左束支部ブロック(LBBB)では、異常なQRS波形に対する関連度スコアが最も高く、T波がQRS波と一致する(同一方向)場合に最も低くなる。これは臨床的基準と一致している。
  • 疾患を示唆しない特徴(例:AFにおける正常なP波、LBBBにおける同一方向のT波)に対して負の関連度スコアが割り当てられていることから、教科書知識と整合していることが確認された。
  • LBBBの関連度スコアは、異常なQRS波形が最も診断的であるとされる誘導V1およびaVLで、臨床ガイドラインと強く一致している。
  • 誤分類はしばしば関連度スコアが0に近い状態と関連しており、ノイズやアーティファクトが存在する際、モデルが重要な特徴に注目できていないことが示唆された。
  • IGおよびLRPの両手法が、データベース間で一貫した結果を示しており、IGは臨床的解釈に適した明確で解釈可能なヒートマップを生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。