Skip to main content
QUICK REVIEW

[論文レビュー] Murmur Detection Using Parallel Recurrent & Convolutional Neural Networks.

Shahnawaz Alam, Rohan Banerjee|arXiv (Cornell University)|Aug 13, 2018
Phonocardiography and Auscultation Techniques参考文献 5被引用数 12
ひとこと要約

本稿では、MFCC特徴量とスペクトログラムを用いて心音を正常または雑音として分類するため、双方向長短期記憶(BiLSTM)と畳み込みニューラルネットワーク(CNN)モデルを組み合わせた並列ディープラーニングアーキテクチャを提案する。5-fold交差検証により、大規模で多様なPCGデータセット上で96.09%の感受性、100%の特異性、98.01%のF1スコアを達成し、個々のネットワークを上回り、心拍分類や発現検出に依存しないことを実証した。

ABSTRACT

In this article, we propose a novel technique for classification of the Murmurs in heart sound. We introduce a novel deep neural network architecture using parallel combination of the Recurrent Neural Network (RNN) based Bidirectional Long Short-Term Memory (BiLSTM) & Convolutional Neural Network (CNN) to learn visual and time-dependent characteristics of Murmur in PCG waveform. Set of acoustic features are presented to our proposed deep neural network to discriminate between Normal and Murmur class. The proposed method was evaluated on a large dataset using 5-fold cross-validation, resulting in a sensitivity and specificity of 96 +- 0.6 % , 100 +- 0 % respectively and F1 Score of 98 +- 0.3 %.

研究の動機と目的

  • 手動による心拍分類や発現検出に依存しない、自動的で頑健な分類器の開発を目的とする。
  • ノイズやデータ分布の変化に敏感な従来の特徴量抽出手法の限界を解消することを目的とする。
  • 心音図(PCG)信号における時間的依存性(BiLSTMによるモデル化)とスペクトルパターン(CNNによるモデル化)を同時に扱うことで、分類性能を向上させることを目的とする。
  • 実世界のノイズ、運動アーチファクト、多様な病理状態を含む大規模で多様なデータセットを用いて、一般化性能を評価することを目的とする。

提案手法

  • モデルは、65×61のスペクトログラムから空間的・スペクトル的特徴を抽出するため、ReLU関数とバッチ正則化を備えた3層のCNNに続いて、マックスプーリングとL2正則化を適用する。
  • 13次元のMFCCシーケンス(398フレーム)を処理する2層のBiLSTMネットワークが、心音サイクルにおける長期的時間的パターンを捉える。
  • CNNおよびBiLSTMの出力は、それぞれ128ユニットの全結合層を経て連結され、256ユニットの表現に統合される。
  • 統合表現は、128ユニットの第2全結合層および2ユニットのソフトマックス出力層(正常対雑音の二値分類用)を通過する。
  • ネットワークは交差エントロピー損失関数を用い、固定学習率1e-3、ミニバッチサイズ128で訓練され、すべての層に80%のドロップアウトを適用して過学習を防止する。
  • クラス不均衡は、各foldの訓練段階で少数クラス(雑音)をアップサンプリングすることで緩和され、テストセットは変更せず、被験者に依存しないように保たれ、データ漏洩を回避する。

実験結果

リサーチクエスチョン

  • RQ1心拍分類を必要としない並列CNN-BiLSTMアーキテクチャは、PCG信号からスペクトル的および時間的特徴を効果的に学習し、雑音分類に有効であるか?
  • RQ2同じデータセット上で、統合されたCNN-BiLSTMモデルの性能は、個々のCNNまたはBiLSTMモデルと比較してどのように異なるか?
  • RQ3本手法は、ノイズ、アーチファクト、病理状態にばらつきのある多様なPCG記録において、どの程度一般化可能か?
  • RQ4データ増強技術によるバイアスの導入を避けながら、不均衡なデータで学習した場合でも、本モデルは高い特異性と感受性を維持できるか?

主な発見

  • 提案されたBiLSTM + CNNモデルは、5-fold交差検証において96.09%の感受性、100%の特異性、98.01%のF1スコアを達成し、単体のCNNおよびBiLSTMモデルを顕著に上回った。
  • 単体のCNNは87.04%の感受性と100%の特異性を示したが、単体のBiLSTMは97.14%の感受性と85.49%の特異性を示し、クラス固有のバイアスが顕在した。
  • 並列アーキテクチャは、個々のモデルの弱みを効果的に緩和した:CNNはノイズの強い正常音に対して苦労し、BiLSTMは周期的な雑音を正常と誤分類する傾向があった。
  • クラス固有のアップサンプリングを訓練段階で適用したことで、データ不均衡に対するモデルの頑健性が実証されたが、テストセットの整合性は損なわれなかった。
  • 心拍分類や発現検出を必要としないため、誤りの多い前処理工程への依存が低減され、実用的応用性が向上した。
  • 視覚的(スペクトログラム)および時間的(MFCCシーケンス)特徴を統合的にモデル化することで、特徴工学に基づく手法に比べて優れた分類性能が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。