[論文レビュー] Deep Neural Network Based Respiratory Pathology Classification Using Cough Sounds
本研究では、メル周波数ケプストラム係数(MFCCs)を用いた双方向LSTM(BiLSTM)の深層学習モデルを提案し、咳音を健康または病的な呼吸器疾患(アレルギー性喘息、上気道感染症[URTI]、下気道感染症[LRTI])に分類する。臨床医による確認済みラベルが付与された実世界のスマートフォン収集データセットを用いて訓練されたモデルは、被験者ごとに複数の咳音を統合することで91%を超える正確性を達成し、モバイルベースの呼吸器スクリーニングにおける強力な可能性を示している。
Intelligent systems are transforming the world, as well as our healthcare system. We propose a deep learning-based cough sound classification model that can distinguish between children with healthy versus pathological coughs such as asthma, upper respiratory tract infection (URTI), and lower respiratory tract infection (LRTI). In order to train a deep neural network model, we collected a new dataset of cough sounds, labelled with clinician's diagnosis. The chosen model is a bidirectional long-short term memory network (BiLSTM) based on Mel Frequency Cepstral Coefficients (MFCCs) features. The resulting trained model when trained for classifying two classes of coughs -- healthy or pathology (in general or belonging to a specific respiratory pathology), reaches accuracy exceeding 84\% when classifying cough to the label provided by the physicians' diagnosis. In order to classify subject's respiratory pathology condition, results of multiple cough epochs per subject were combined. The resulting prediction accuracy exceeds 91\% for all three respiratory pathologies. However, when the model is trained to classify and discriminate among the four classes of coughs, overall accuracy dropped: one class of pathological coughs are often misclassified as other. However, if one consider the healthy cough classified as healthy and pathological cough classified to have some kind of pathologies, then the overall accuracy of four class model is above 84\%. A longitudinal study of MFCC feature space when comparing pathological and recovered coughs collected from the same subjects revealed the fact that pathological cough irrespective of the underlying conditions occupy the same feature space making it harder to differentiate only using MFCC features.
研究の動機と目的
- 実世界の音声データを用いて、咳音を健康または病的な呼吸器疾患に分類する自動化された深層学習ベースのシステムの開発。
- MFCC特徴量を用いて訓練されたBiLSTMモデルの性能を、小児における健康咳と病的咳の区別に評価すること。
- スマートフォンで収集された咳音記録を用いた呼吸器疾患の臨床的スクリーニングの可能性を検討すること。
- モデルが複数の特定病態(喘息、URTI、LRTI)を区別する能力を評価し、多クラス分類における限界を同定すること。
- 同一被験者からの病的咳と回復後の咳の間でMFCC特徴空間に生じる縦断的変化を分析し、特徴の安定性を理解すること。
提案手法
- 臨床医による診断が確認された実際の病院環境で、スマートフォンを用いて小児の咳音を収集した新規データセットを構築した。
- 生の咳音信号からメル周波数ケプストラム係数(MFCCs)を抽出して音声特徴量とした。
- MFCC特徴量を入力として、咳音を2クラス(健康対病的)に分類する双方向長短期記憶(BiLSTM)ニューラルネットワークを訓練した。
- 多クラス分類の目的で、4クラス(健康、喘息、URTI、LRTI)を区別するようにモデルを訓練した。
- 被験者ごとの複数の咳音エポックの予測を多数決で統合することで、予測の信頼性を向上させ、単一サンプルのばらつきを低減した。
- 同一被験者からの病的咳と回復後の咳の間でMFCC特徴空間の縦断的分析を実施した。
実験結果
リサーチクエスチョン
- RQ1MFCC特徴量とBiLSTMアーキテクチャを用いた深層学習モデルは、実世界のスマートフォン録音を用いて、咳音を健康または病的呼吸器疾患に正確に分類できるか?
- RQ2一般病態(健康対任意の病態)と特定病態(喘息、URTI、LRTI)の区別において、分類精度はどのように変化するか?
- RQ3被験者1人あたりの複数の咳音からの予測を統合することで、全体の分類性能にどのような影響が生じるか?
- RQ44クラス分類(健康、喘息、URTI、LRTI)において、なぜ分類精度が低下するのか、誤分類のパターンは何か?
- RQ5異なる原因疾患に起因する病的咳が、MFCC特徴空間内でどの程度重複領域を占めているか?
主な発見
- BiLSTMモデルは、個々の咳音サンプルを用いて訓練した場合、健康対病的(一般または特定疾患)の分類で84%を超える正確性を達成した。
- 被験者ごとに複数の咳音エポックの予測を多数決で統合した結果、喘息、URTI、LRTIの3つの特定疾患すべてで分類正確性が91%を超えた。
- 4クラス分類タスク(健康、喘息、URTI、LRTI)では、全体の正確性が低下し、病的クラス同士が頻繁に誤分類された。
- しかし、より広範な2クラスタスク(健康対任意の病態)では、全体の正確性が84%以上を維持しており、疾患の存在を検出する能力に優れていることが示された。
- 縦断的分析から、喘息、URTI、LRTIに起因する病的咳が、MFCC特徴空間で類似した領域を占めていることが判明し、MFCCのみでそれらを区別することが困難であることが説明された。
- 本研究は、スマートフォンを用いた咳音記録が臨床的スクリーニングに実用可能であり、早期呼吸器疾患検出のためのモバイルヘルスアプリケーション開発を支援するものであることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。