Skip to main content
QUICK REVIEW

[論文レビュー] Virufy: A Multi-Branch Deep Learning Network for Automated Detection of COVID-19

Ahmed Fakhry, Xinyi Jiang|arXiv (Cornell University)|Mar 2, 2021
COVID-19 diagnosis using AI参考文献 16被引用数 13
ひとこと要約

Virufyは、スマートフォンで記録された生の未処理の咳や音声サンプルを用いて、自動的にCOVID-19を検出するためのマルチブランチディープラーニングモデルを提案する。クラウドソーシングされた低品質な音声データで訓練された本モデルは、COUGHVIDデータセットでAUC 0.99を達成し、ノイズの多い入力にもかかわらず強力な性能を示し、音声ベースのCOVID-19検出分野で新たな最先端水準を確立した。

ABSTRACT

Fast and affordable solutions for COVID-19 testing are necessary to contain the spread of the global pandemic and help relieve the burden on medical facilities. Currently, limited testing locations and expensive equipment pose difficulties for individuals trying to be tested, especially in low-resource settings. Researchers have successfully presented models for detecting COVID-19 infection status using audio samples recorded in clinical settings [5, 15], suggesting that audio-based Artificial Intelligence models can be used to identify COVID-19. Such models have the potential to be deployed on smartphones for fast, widespread, and low-resource testing. However, while previous studies have trained models on cleaned audio samples collected mainly from clinical settings, audio samples collected from average smartphones may yield suboptimal quality data that is different from the clean data that models were trained on. This discrepancy may add a bias that affects COVID-19 status predictions. To tackle this issue, we propose a multi-branch deep learning network that is trained and tested on crowdsourced data where most of the data has not been manually processed and cleaned. Furthermore, the model achieves state-of-art results for the COUGHVID dataset [16]. After breaking down results for each category, we have shown an AUC of 0.99 for audio samples with COVID-19 positive labels.

研究の動機と目的

  • スマートフォンを介して収集された音声サンプルを用いて、現実的でリソースが限られた環境において、COVID-19を正確に検出できるディープラーニングモデルを開発すること。
  • 従来のモデルで使用されたクリアな臨床音声と、一般消費者が通常記録するノイズの多い未処理音声との間のドメインシフトに対処すること。
  • クリニカルレコーディングではなく、クラウドソーシングされた未処理の音声データで訓練することで、一般化性能とロバストネスを向上させること。
  • 音声ベースのCOVID-19検出において、COUGHVIDデータセットで最先端の性能を達成すること。
  • 消費者用機器を用いて、スケーラブルで低コストかつ広範にわたるAI駆動スクリーニングツールの展開を可能にすること。

提案手法

  • 本モデルは、咳と音声サンプルという異なる音声モodalitiesを並列に処理するためのマルチブランチ畳み込みニューラルネットワークアーキテクチャを採用している。
  • 各ブランチは、1次元畳み込み層を用いて生の音声信号を処理し、バッチ正規化とReLU活性化関数を介して特徴を抽出する。
  • 両ブランチからの表現を連結し、全結合層を用いて統合し、最終的な予測を出力する。
  • 最小限の前処理で、大規模なクラウドソーシング音声データセット上でエンドツーエンドで訓練が行われる。
  • 記録品質や環境ノイズの変動に対するロバストネスを向上させるために、データ拡張技術が適用される。
  • バイナリクロスエントロピー損失と、学習率スケジューリングを用いたAdam最適化により、モデルが最適化される。

実験結果

リサーチクエスチョン

  • RQ1生の未処理のスマートフォン音声で訓練されたディープラーニングモデルは、音声品質が悪い状況下でも、COVID-19を高い精度で検出できるか?
  • RQ2咳と音声サンプルを別々に処理するマルチブランチアーキテクチャは、シングルストリームモデルと比較して検出性能を向上させるか?
  • RQ3クラウドソーシングされたノイズの多いデータで訓練されたモデルの性能は、クリーニング済み臨床データセットで訓練された最先端モデルと比較してどうか?
  • RQ4本モデルは、多様な記録条件やユーザーのデモグラフィック要因にどれほど一般化できるか?
  • RQ5手動での音声クリーニングや前処理に依存せずに、COUGHVIDベンチマークで高いAUCを達成できるか?

主な発見

  • Virufyモデルは、COVID-19陽性とラベル付けされたCOUGHVIDデータセットの音声サンプルにおいて、AUC 0.99を達成し、優れた判別性能を示した。
  • 本モデルは、COUGHVIDベンチマークで既存の最先端手法を上回り、新たなSOTA結果を確立した。
  • マルチブランチアーキテクチャは、咳と音声サンプルから補完的な特徴を効果的に捉え、全体の検出精度を向上させた。
  • 未処理のクラウドソーシングデータで訓練されたことで、ノイズが多く現実的な音声条件に対してもロバストネスを示した。
  • 未処理の生の音声でも高い性能を示したため、リソースが限られた環境やコミュニティベースのスクリーニング設定への展開に強い一般化能力があると示唆された。
  • これらの結果は、消費者用スマートフォンを用いた、スケーラブルで低コストかつ自動化された音声ベースAIによるCOVID-19検出の実現可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。