Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Tuberculosis from Real-World Cough Audio Recordings and Metadata

George P. Kafentzis, Stephane Tetsing|arXiv (Cornell University)|Jul 10, 2023
Respiratory and Cough-Related Research被引用数 4
ひとこと要約

本研究では、低資源地域におけるモバイルアプリを介して収集された咳音録音と臨床メタデータを用いて、結核(TB)を予測する機械学習モデルの開発と評価を行った。咳音と人口統計・臨床データを組み合わせた場合、AUCは0.81±0.05に達した。これは、モバイルベースの音声および症状分析が、結核の症例同定効率を向上させられることを示している。

ABSTRACT

Tuberculosis (TB) is an infectious disease caused by the bacterium Mycobacterium tuberculosis and primarily affects the lungs, as well as other body parts. TB is spread through the air when an infected person coughs, sneezes, or talks. Medical doctors diagnose TB in patients via clinical examinations and specialized tests. However, coughing is a common symptom of respiratory diseases such as TB. Literature suggests that cough sounds coming from different respiratory diseases can be distinguished by both medical doctors and computer algorithms. Therefore, cough recordings associated with patients with and without TB seems to be a reasonable avenue of investigation. In this work, we utilize a very large dataset of TB and non-TB cough audio recordings obtained from the south-east of Africa, India, and the south-east of Asia using a fully automated phone-based application (Hyfe), without manual annotation. We fit statistical classifiers based on spectral and time domain features with and without clinical metadata. A stratified grouped cross-validation approach shows that an average Area Under Curve (AUC) of approximately 0.70 $\pm$ 0.05 both for a cough-level and a participant-level classification can be achieved using cough sounds alone. The addition of demographic and clinical factors increases performance, resulting in an average AUC of approximately 0.81 $\pm$ 0.05. Our results suggest mobile phone-based applications that integrate clinical symptoms and cough sound analysis could help community health workers and, most importantly, health service programs to improve TB case-finding efforts while reducing costs, which could substantially improve public health.

研究の動機と目的

  • 実世界のコミュニティベースの環境から得た咳音録音と臨床メタデータを用いて、TB状態を予測する機械学習モデルの開発を目的とする。
  • 自動化されたスマートフォンベースのデータ収集を用いて、咳音による結核と非結核の区別を目的とした、従来の機械学習およびディープラーニングモデルの性能を評価することを目的とする。
  • 臨床および人口統計的メタデータを統合することで、咳音のみに比べて結核予測の正確性が向上するかどうかを評価することを目的とする。
  • 今後のAI駆動の結核スクリーニング分野における研究を支援するため、公開可能な大規模データセットとベンチマークを提供することを目的とする。
  • 低コストで非侵襲的なデジタルツールを実現することで、公衆衛生活動を支援し、コミュニティベースの結核症例同定を可能とすることを目的とする。

提案手法

  • Hyfeと呼ばれる完全に自動化されたスマートフォンベースのアプリケーションを用いて、7か国で咳音録音と臨床メタデータの大規模データセットを収集した。手動によるアノテーションは行わなかった。
  • MFCC、スペクトルセントロイド、ゼロクロスレート、ログメルスペクトログ램などを含む、周波数的・時間的・スペクトロテムポラル特徴を含む低レベル音響特徴(LLDs)を抽出した。
  • 音声のみおよび音声+メタデータ入力の両方を用いて、従来の機械学習モデル(例:ロジスティック回帰、SVM、ランダムフォレスト、AdaBoost、MLP)を訓練した。
  • 咳音のスペクトログラム表現を用いて、2次元畳み込みニューラルネットワーク(2D-CNN)を適用し、階層的なパターンを学習した。
  • 参加者レベルのデータ構造を考慮し、データ漏洩を回避するため、階層的グループ化交差検証を実施した。
  • 複数の咳音からの予測を重み付き平均化することで、参加者レベルの分類性能を向上させた。
Figure 1: Feature Extraction Pipeline.
Figure 1: Feature Extraction Pipeline.

実験結果

リサーチクエスチョン

  • RQ1現実世界のコミュニティベースの集団において、咳音録音のみで結核状態を信頼性高く予測できるか?
  • RQ2臨床および人口統計的メタデータを含めることで、咳音を用いた結核予測モデルの性能にどのような影響を与えるか?
  • RQ3従来の機械学習モデルとディープラーニングモデルのうち、どちらが咳音とメタデータを用いた結核分類において優れた性能を示すか?
  • RQ41人の被験者に対して複数回の咳音を用いて予測を統合することで、全体の診断正確性が向上するか?
  • RQ5モバイルベースの音声および症状分析は、高負担・低資源地域における結核症例同定のためのスケーラブルで低コストなツールとして機能できるか?

主な発見

  • 咳音のみの実験では、最も性能の高かったモデル(2D-CNN)が、咳音レベル分類タスクで平均AUC 0.70±0.05を達成した。
  • 咳音確率の集約を用いた参加者レベル分類では、咳音レベルの予測よりもすべてのモデルが高いAUCを達成した。
  • 咳音+メタデータ実験では、MLPを除くすべてのモデルが平均AUC 0.80を超えた。アンサンブルモデルのAdaBoostは、咳音レベルで0.82±0.05のAUCを達成した。
  • 臨床および人口統計的メタデータの追加により、平均AUCは咳音のみの約0.70から、咳音+メタデータの約0.81に上昇し、顕著な性能向上が確認された。
  • ロジスティック回帰とAdaBoostが、ランダムフォレストやMLPといったより複雑なモデルよりも優れた性能を示した。これは、このタスクにおいて単純なモデルがより効果的である可能性を示唆している。
  • 咳音レベルの予測を重み付き平均化することで、参加者レベルの分類性能が向上した。これは、アンサンブル戦略がシステムの耐性を高められることを示している。
Figure 2: Audio recordings, log-mel spectrograms, and mel-frequency cepstral coefficients for two cough sounds, one from a TB patient (upper three panels), and one from a healthy patient (lower three panels).
Figure 2: Audio recordings, log-mel spectrograms, and mel-frequency cepstral coefficients for two cough sounds, one from a TB patient (upper three panels), and one from a healthy patient (lower three panels).

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。