[논문 리뷰] Detecting COVID-19 from Breathing and Coughing Sounds using Deep Neural Networks
이 논문은 모바일 기기에서 COVID-19를 탐지하기 위해 원시 음성과 기침 소리의 스펙트로그램을 사용하는 딥러닝 접근법을 제안한다. 베이지안 최적화와 HyperBand을 활용한 베이지안 최적화 및 HyperBand을 활용한 앙상블 컨volution 네트워크를 사용하며, 엄격한 주체 독립 테스트에서 74.9%의 무게화되지 않은 평균 재현율(UAR)과 80.7%의 AUC를 달성한다. 호흡 소리가 기침 소리보다 성능이 뛰어나, 호흡 소리가 더 구분력 있는 특징을 포함할 수 있음을 시사한다.
The COVID-19 pandemic has affected the world unevenly; while industrial economies have been able to produce the tests necessary to track the spread of the virus and mostly avoided complete lockdowns, developing countries have faced issues with testing capacity. In this paper, we explore the usage of deep learning models as a ubiquitous, low-cost, pre-testing method for detecting COVID-19 from audio recordings of breathing or coughing taken with mobile devices or via the web. We adapt an ensemble of Convolutional Neural Networks that utilise raw breathing and coughing audio and spectrograms to classify if a speaker is infected with COVID-19 or not. The different models are obtained via automatic hyperparameter tuning using Bayesian Optimisation combined with HyperBand. The proposed method outperforms a traditional baseline approach by a large margin. Ultimately, it achieves an Unweighted Average Recall (UAR) of 74.9%, or an Area Under ROC Curve (AUC) of 80.7% by ensembling neural networks, considering the best test set result across breathing and coughing in a strictly subject independent manner. In isolation, breathing sounds thereby appear slightly better suited than coughing ones (76.1% vs 73.7% UAR).
연구 동기 및 목표
- 특히 진단 재료와 인프라가 제한된 개발도상국에서의 전 세계적인 COVID-19 검사 능력 격차를 해소하기 위해.
- 확보 가능한 모바일 기기들을 활용해 저비용으로 광범위하게 사용 가능한 사전 검사 방법을 개발하여 확진 검사 이전에 잠재적인 COVID-19 감염자를 탐지하기 위해.
- 딥러닝을 통해 오디오 신호—특히 호흡과 기침 소리—를 이용해 COVID-19 감염 여부를 나타내는 지표로 사용할 수 있는지 탐색하기 위해.
- 베이지안 최적화와 HyperBand을 통한 자동 하이퍼파rameter 튜닝을 통해 탐지 정확도를 향상시키기 위해.
제안 방법
- 딥러닝 모델의 입력 특징으로 원시 음성과 다양한 힙 길이를 가진 다수의 스펙트로그램 표현을 사용한다.
- 원시 음성과 스펙트로그램 각각을 처리하는 이중 분지 컨volution 네트워크(CNN) 아키텍처를 활용한다. 각 분지는 입력을 독립적으로 처리한다.
- 각 분지는 ReLU 활성화 함수를 가지며, 1D 컨볼루션 블록 스택, 맥스 풀링, 20% 드롭아웃을 포함하여 과적합을 줄인다.
- 시간 차원을 감소시키기 위해 글로벌 평균 풀링과 최대 풀링을 적용한 후, 최종 분류 이전에 표현을 연결한다.
- 조기 정지와 L2 정규화를 사용한 확률적 경사 하강법으로 개별 모델을 훈련하며, 하이퍼파rameter를 베이지안 최적화와 HyperBand을 통해 최적화한다.
- 성능이 뛰어난 모델들을 모델 평균화를 통해 앙상블하여 주체 독립 테스트 세트에서의 강인성과 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1딥 네트워크는 충분한 정확도로 호흡과 기침 소리에서 COVID-19를 탐지하여 사전 선별 도구로 활용할 수 있는가?
- RQ2오디오 기반 탐지 성능은 호흡과 기침 모odal리티 간에 어떻게 달라지는가?
- RQ3자동 하이퍼파rameter 튜닝은 미리 보지 않은 주체에 대한 모델 일반화와 성능 향상에 얼마나 기여하는가?
- RQ4모델 앙상블은 다양한 데이터 분할에 걸쳐 예측의 안정성과 신뢰성에 어떻게 영향을 주는가?
주요 결과
- 제안된 앙상블 모델은 엄격한 주체 독립 테스트 세트에서 74.9%의 무게화되지 않은 평균 재현율(UAR)과 80.7%의 ROC 곡선 아래 면적(AUC)을 달성했다.
- 호흡 소리는 76.1%의 UAR를 기록하여 기침 소리의 73.7%보다 높은 성능을 보였으며, 이는 호흡 소리가 COVID-19 탐지에 더 많은 구분력 있는 특징을 포함할 수 있음을 시사한다.
- 모델 성능은 다양한 교차 검증 폴드 간에 크게 달라졌으며, 개별 모델에서 표준편차가 높게 관찰되어 데이터 분할과 초기화에 민감함을 시사한다.
- 앙상블 모델는 UAR와 AUC 모두에서 가장 낮은 표준편차를 보였으며, 개별 모델 대비 더 높은 안정성과 강인성을 입증했다.
- 결과는 오디오 기반 탐지가 저비용 사전 선별 방법으로 가능하다는 것을 시사하지만, 현재 데이터셋의 크기가 작음(원본 샘플 2시간)으로 인해 성능에 제한이 있음을 시사한다.
- 향후 데이터 수집은 더 많은 호흡 기록을 우선적으로 고려하고, 다른 호흡기 질환 환자를 포함한 다양한 대조군을 포함하여 모델의 일반화 능력과 진단 유용성을 향상시켜야 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.