Skip to main content
QUICK REVIEW

[論文レビュー] Heart Sound Classification Considering Additive Noise and Convolutional Distortion

Farhat Binte Azam, Md. Istiaq Ansari|arXiv (Cornell University)|Jun 3, 2021
Phonocardiography and Auscultation Techniques被引用数 7
ひとこと要約

本稿では、加法性ノイズおよびセンサ由来の畳み込み歪みの下でも頑健な心音分類を実現するため、線形フィルタバンク(Fbank)とメル周波数 cepstral コ efficient(MFCC)特徴を組み合わせる新しい特徴統合手法を提案する。Fbank と MFCC-13 特徴を統合した入力に対して残差畳み込みニューラルネットワーク(ResNet)を適用した結果、AUC 91.36%、F1 スコア 84.09%、Macc 85.08% の成績を達成し、従来手法を著しく上回り、特にノイズ環境および複数のステトスコープを用いた環境下でも優れた性能を示す。

ABSTRACT

Cardiac auscultation is an essential point-of-care method used for the early diagnosis of heart diseases. Automatic analysis of heart sounds for abnormality detection is faced with the challenges of additive noise and sensor-dependent degradation. This paper aims to develop methods to address the cardiac abnormality detection problem when both types of distortions are present in the cardiac auscultation sound. We first mathematically analyze the effect of additive and convolutional noise on short-term filterbank-based features and a Convolutional Neural Network (CNN) layer. Based on the analysis, we propose a combination of linear and logarithmic spectrogram-image features. These 2D features are provided as input to a residual CNN network (ResNet) for heart sound abnormality detection. Experimental validation is performed on an open-access heart sound abnormality detection dataset involving noisy recordings obtained from multiple stethoscope sensors. The proposed method achieves significantly improved results compared to the conventional approaches, with an area under the ROC (receiver operating characteristics) curve (AUC) of 91.36%, F-1 score of 84.09%, and Macc (mean of sensitivity and specificity) of 85.08%. We also show that the proposed method shows the best mean accuracy across different source domains including stethoscope and noise variability, demonstrating its effectiveness in different recording conditions. The proposed combination of linear and logarithmic features along with the ResNet classifier effectively minimizes the impact of background noise and sensor variability for classifying phonocardiogram (PCG) signals. The proposed method paves the way towards developing computer-aided cardiac auscultation systems in noisy environments using low-cost stethoscopes.

研究の動機と目的

  • 実臨床現場における点検的応用環境で性能を低下させる加法性ノイズと畳み込み歪みの併存する課題に取り組む。
  • 多様なステトスコープセンサおよびノイズの高い記録環境下でも、自動心音解析の頑健性を向上させる。
  • 背景ノイズおよびセンサのばらつきの影響を最小限に抑える特徴工学的手法を開発する。
  • 従来手法と比較して、異なるソースドメイン(異なるステトスコープおよびノイズレベル)にわたる一般化性能が優れていることを示す。
  • 深層学習フレームワーク内での線形および対数周波数スペクトログラム特徴の統合が、PCG信号分類に有効であることを検証する。

提案手法

  • 加法性歪みおよび畳み込み歪みが短時間フィルタバンク特徴およびCNN層に与える影響を数学的に分析し、頑健な特徴設計の根拠を提供する。
  • PCG信号から線形フィルタバンクエネルギー(Fbank)およびメル周波数 cepstral コ efficient(MFCC-13)特徴を抽出し、補完的表現とする。
  • Fbank と MFCC-13 特徴を統合して2次元入力行列を構築し、深層学習に適した時間的・周波数的ダイナミクスを保持する。
  • 統合されたスペクトログラム特徴から階層的パターンを学習可能な残差畳み込みニューラルネットワーク(ResNet)を分類器として採用する。
  • 異なるステトスコープセンサおよびノイズ条件における公平な評価を確保するため、ドメインバランス型学習(DBT)を適用する。
  • ベースラインモデルとの性能向上を統計的に検証するため、McNemar のカイ二乗検定を用いる。

実験結果

リサーチクエスチョン

  • RQ1加法性ノイズと畳み込み歪みが心音分類システムの性能に同時に与える影響は何か?
  • RQ2線形フィルタバンクエネルギーと対数メルスペクトログラム特徴の統合は、ノイズおよびセンサばらつきに対する頑健性を向上させ得るか?
  • RQ3提案手法の特徴統合戦略は、ノイズ環境および複数の情報源環境下で、従来手法に比べて統計的に有意な性能向上をもたらすか?
  • RQ4提案手法は、異なるステトスコープセンサおよびノイズレベルにわたって、従来手法と比較してどのように一般化性能を示すか?
  • RQ5分類性能の向上は、ランダムなばらつきやデータリークではなく、特徴統合戦略に起因するものか?

主な発見

  • 提案手法は受信器特性曲線下の面積(AUC)が 91.36% に達し、ベースラインモデルと比較して顕著な向上を示した。
  • F1 スコアは 84.09%、感度と特異度の平均(Macc)は 85.08% を達成し、全体的な性能が優れていることを示した。
  • Fbank と MFCC-13 特徴の統合は、Potes-CNN-DBT ベースラインシステムと比較して統計的に有意な改善(p < 0.05)をもたらしたことが、McNemar の検定により確認された。
  • 異なるソースドメイン(さまざまなステトスコープおよびノイズレベル)においても、平均精度が最も高く、一般化性能が優れていることを示した。
  • Humayun 他(2023)の tConv-CNN-DBT システムと比較して Macc で 3.59% の向上を示したが、p > 0.05 であったため統計的に有意ではなかった。これは一貫したが極端ではない向上を示している。
  • TSNE 視覚化ではソースドメインごとの明確なクラスタリングが認められず、ドメインシフトにもかかわらずモデルが不変表現を学習していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。