[논문 리뷰] Audio, Speech, Language, & Signal Processing for COVID-19: A Comprehensive Overview
이 논문은 코로나19 선별, 진단, 모니터링 및 인식 향상을 위한 인공지능 기반 음성, 음향 및 신호 처리 기법에 대한 종합적인 리뷰를 제시한다. MFCC, NMF 및 딥러닝 모델과 같은 음성 및 음향 특징을 활용하여 기침, 호흡 불규칙성 및 정서적 스트레스와 같은 호흡기 증상을 탐지하며, 기침 기반 탐지에서 최대 91.6% AUC를 기록하고 수면 부족 및 우울증 예측에서 유의미한 상관관계 점수를 확보하였다.
The Coronavirus (COVID-19) pandemic has been the research focus world-wide in the year 2020. Several efforts, from collection of COVID-19 patients' data to screening them for the virus's detection are taken with rigour. A major portion of COVID-19 symptoms are related to the functioning of the respiratory system, which in-turn critically influences the human speech production system. This drives the research focus towards identifying the markers of COVID-19 in speech and other human generated audio signals. In this paper, we give an overview of the speech and other audio signal, language and general signal processing-based work done using Artificial Intelligence techniques to screen, diagnose, monitor, and spread the awareness aboutCOVID-19. We also briefly describe the research related to detect accord-ing COVID-19 symptoms carried out so far. We aspire that this collective information will be useful in developing automated systems, which can help in the context of COVID-19 using non-obtrusive and easy to use modalities such as audio, speech, and language.
연구 동기 및 목표
- 코로나19 극복을 위한 인공지능 기반 음성, 음향 및 신호 처리 연구를 통합하고 분석하기 위해.
- 음성 및 음향 신호를 활용한 비침습적, 저비용, 확장 가능한 코로나19 선별 및 모니터링 방법을 식별하기 위해.
- 컴퓨터 기반 부언어 및 정서 컴퓨팅이 패닉 기간 동안 스트레스, 불안 및 우울증을 탐지하는 데서 수행하는 역할을 평가하기 위해.
- 현재 연구의 격차를 부각하고 자동화, 신뢰성 있고 임상 기준에 부합하는 도구의 향후 개발을 안내하기 위해.
- 음성 기반 시스템을 챗봇 및 디지털 헬스 플랫폼과 통합하여 공중보건 영향을 증대시키기 위해.
제안 방법
- 코로나19 적용을 위한 음성 및 음향 처리에 관한 100개 이상의 연구에 대한 체계적 리뷰.
- XGBoost, SVM 및 주의 기반 네트워크와 같은 머신러닝 및 딥러닝 모델을 음성 및 음향 데이터셋에 적용.
- 멜 주파수 페스털 계수(MFCC), 비음수 행렬 분해(NMF), 감마톤 주파수 페스털 계수(GFCC)를 포함한 신호 처리 기법 사용.
- 회귀 및 분류 성능 향상을 위해 피셔 벡터, 오디오 단어의 집합(BoAW), 주의 메커니즘과 같은 고급 특징 표현 활용.
- 모델 크기를 성능 손실 없이 95% 감소시키기 위해 네트워크 프루닝 및 양자화를 통한 모델 최적화.
- 스트레스 및 수면 부족 탐지에 사용된 기존 데이터셋인 DAICWOZ 및 Interspeech 2019 챌린지 데이터 활용.
실험 결과
연구 질문
- RQ1음성 및 음향 신호는 기침 이상, 호흡 패턴 이상과 같은 코로나19의 조기 징후를 신뢰성 있게 탐지할 수 있는가?
- RQ2음향 특징을 활용해 기계학습 모델이 기침 특징을 통해 다른 호흡기 질환과 코로나19 관련 기침을 얼마나 효과적으로 구분할 수 있는가?
- RQ3패닉 기간 동안 정서적 고통, 피로 또는 수면 부족을 음성 및 음향 처리 기법으로 얼마나 잘 탐지할 수 있는가?
- RQ4공중보건 위기 상황에서 실생활 적용이 가능하고 확장 가능하며 개인정보 보호 기준을 충족하는 음성 기반 선별 시스템을 구현할 때의 주요 과제는 무엇인가?
- RQ5음성 및 언어 처리 기술을 챗봇과 통합하면 공중보건 인식 향상과 오해의 소거를 위해 어떻게 기여할 수 있는가?
주요 결과
- 12개의 MFCC와 XGBoost를 사용한 기침 소리 탐지에서 AUC가 0.916에 도달하여 강력한 진단 잠재력을 보였다.
- NMF 기반 특징 추출은 전통적 특징인 MFCC 및 GFCC 대비 정확도, 재현율, F1 스코어를 각각 1% 향상시켰다.
- COMPARE 특징과 피셔 벡터를 사용한 수면 부족 탐지에서 950명의 대상자 데이터셋에서 슼머의 상관계수 0.383를 기록했다.
- DAICWOZ 데이터셋에서 계층적 주의 전이 네트워크를 사용한 우울증 예측 결과, RMSE는 5.66, MAE는 4.28을 기록했다.
- 모델 압축 기법을 통해 딥러닝 모델 크기를 성능 저하 없이 95% 감소시켜 현장 장치에의 구현 가능성을 확보했다.
- 음성 기반 선별 시스템을 챗봇과 통합하면 인간 간섭을 줄이고 공중보건 모니터링의 확장성을 향상시킬 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.