Skip to main content
QUICK REVIEW

[論文レビュー] A Residual Network based Deep Learning Model for Detection of COVID-19 from Cough Sounds

Annesya Banerjee, Achal Nilhani|arXiv (Cornell University)|Jun 4, 2021
COVID-19 diagnosis using AI参考文献 21被引用数 5
ひとこと要約

本論文では、DiCOVA Challenge 2021 Track-1データセットを用いて訓練され、CoughVidデータセットで拡張された、音声データのlog-Melスペクトログ램を用いたResNet-50に基づく深層学習モデルを提案し、COVID-19咳嗽と非COVID-19咳嗽を分類する。テストAUCは75.91%、感度は80.49%、特異度は62.50%を達成し、チャレンジで16位を獲得した。

ABSTRACT

The present work proposes a deep-learning-based approach for the classification of COVID-19 coughs from non-COVID-19 coughs and that can be used as a low-resource-based tool for early detection of the onset of such respiratory diseases. The proposed system uses the ResNet-50 architecture, a popularly known Convolutional Neural Network (CNN) for image recognition tasks, fed with the log-Mel spectrums of the audio data to discriminate between the two types of coughs. For the training and validation of the proposed deep learning model, this work utilizes the Track-1 dataset provided by the DiCOVA Challenge 2021 organizers. Additionally, to increase the number of COVID-positive samples and to enhance variability in the training data, it has also utilized a large open-source database of COVID-19 coughs collected by the EPFL CoughVid team. Our developed model has achieved an average validation AUC of 98.88%. Also, applying this model on the Blind Test Set released by the DiCOVA Challenge, the system has achieved a Test AUC of 75.91%, Test Specificity of 62.50%, and Test Sensitivity of 80.49%. Consequently, this submission has secured 16th position in the DiCOVA Challenge 2021 leader-board.

研究の動機と目的

  • 音声特徴を用いた低リソースで、深層学習ベースのCOVID-19早期検出ツールの開発。
  • 音声ベースの特徴を用いて、COVID-19陽性咳嗽と非COVID-19咳嗽を分類すること。
  • オープンソースの咳嗽データベースを用いたデータ拡張により、モデルの汎化能力を向上させること。
  • 標準的な指標を用いて、DiCOVA Challenge 2021の盲検査定セットでのパフォーマンスを評価すること。
  • 音声信号を用いた非侵襲的でスケーラブルな呼吸器疾患スクリーニングへの貢献。

提案手法

  • モデルは、元々画像分類を目的として設計された、事前学習済みのResNet-50アーキテクチャを採用し、音声入力に適応させた。
  • 音声サンプルは、畳み込みニューラルネットワーク(CNN)による特徴抽出の入力として使用されるlog-Melスペクトログラムに変換される。
  • 訓練データセットは、DiCOVA Challenge 2021 Track-1データセットとCoughVidデータセットを統合し、陽性サンプルの数と多様性を増加させた。
  • データ拡張技術が適用され、トレーニング中のロバストネス向上と過学習の低減が図られた。
  • 標準的な深層学習最適化手法と交差エントロピー損失関数を用いて、モデルのトレーニングと検証が行われた。
  • AUC、感度、特異度を用いて、DiCOVA Challenge 2021の盲検査定セットでのパフォーマンスが評価された。

実験結果

リサーチクエスチョン

  • RQ1ResNet-50に基づく深層学習モデルは、音声特徴のみを用いて、COVID-19咳嗽と非COVID-19咳嗽を効果的に区別できるか?
  • RQ2CoughVidデータセットを用いたデータ拡張は、DiCOVA Challengeのテストセットにおけるモデルパフォーマンスにどのように影響するか?
  • RQ3モデルは、DiCOVA盲検査定セットの未観測で現実世界の咳嗽音サンプルに対して、どの程度の汎化能力を示すか?
  • RQ4低リソース診断環境において、モデルは感度と特異度をどの程度維持できるか?
  • RQ5log-Melスペクトログラムは、咳嗽音における微細な呼吸器異常を特定する有効な表現として機能するか?

主な発見

  • 統合されたトレーニングおよび検証セットにおいて、モデルは平均検証AUC98.88%を達成した。
  • DiCOVA Challenge 2021の盲検査定セットでは、テストAUCが75.91%であった。
  • システムはテスト感度80.49%を示し、陽性例の強力な検出能力を示した。
  • テスト特異度は62.50%であり、非COVID-19例を適切に特定する中程度の割合であった。
  • モデルはDiCOVA Challenge 2021のリーダーボードで16位を獲得し、競争力のあるパフォーマンスを示した。
  • CoughVidデータセットの統合により、トレーニングデータの多様性とモデルのロバストネスが顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。