Skip to main content
QUICK REVIEW

[논문 리뷰] Classification of Speech with and without Face Mask using Acoustic Features

Rohan Kumar Das, Haizhou Li|arXiv (Cornell University)|2020. 10. 08.
Speech Recognition and Synthesis참고 문헌 38인용 수 5
한 줄 요약

이 논문은 음성에서 마스크 착용 여부를 분류하기 위한 새로운 접근법을 제안한다. 선형 주파수 cepstral 계수(LFCC), 순간 주파수余弦 계수(IFCC), 일정-Q cepstral 계수(CQCC)와 같은 음성 특징을 ComParE 2020 기준선과 점수 수준 융합을 통해 조합한다. 이 방법은 테스트 세트에서 73.50%의 무게 조정되지 않은 평균 재현율(UAR)을 달성하여 도전 과제 기준선보다 1.70% 높게 성과를 냈다.

ABSTRACT

The understanding and interpretation of speech can be affected by various external factors. The use of face masks is one such factors that can create obstruction to speech while communicating. This may lead to degradation of speech processing and affect humans perceptually. Knowing whether a speaker wears a mask may be useful for modeling speech for different applications. With this motivation, finding whether a speaker wears face mask from a given speech is included as a task in Computational Paralinguistics Evaluation (ComParE) 2020. We study novel acoustic features based on linear filterbanks, instantaneous phase and long-term information that can capture the artifacts for classification of speech with and without face mask. These acoustic features are used along with the state-of-the-art baselines of ComParE functionals, bag-of-audio-words, DeepSpectrum and auDeep features for ComParE 2020. The studies reveal the effectiveness of acoustic features, and their score level fusion with the ComParE 2020 baselines leads to an unweighted average recall of 73.50% on the test set.

연구 동기 및 목표

  • ComParE 2020에서 제기된 도전 과제인 음성만으로 발화자가 마스크를 착용하고 있는지 여부를 탐지하는 것을 목적으로 한다.
  • LFCC, IFCC, CQCC와 같은 새로운 음성 특징이 마스크로 인한 음성 왜곡을 효과적으로 포착하는지 검토한다.
  • 기존의 ComParE 2020 기준선 시스템과 음성 특징을 점수 수준 융합하여 분류 성능을 향상시킨다.
  • 선형 필터뱅크, 위상 정보, 장기 스펙트럼 동역학의 영향을 마스크 탐지에 대해 평가한다.

제안 방법

  • 선형 필터뱅크를 사용한 LFCC, 순간 위상을 캡처하는 IFCC, 장기 일정-Q 변환(CQT)에서 유도된 CQCC를 포함한 세 가지 새로운 음성 특징을 추출하였다.
  • 기본선으로 MFCC를 사용하여 비교하였으며, 네 가지 ComParE 2020 기준선 시스템인 ComParE 기능 특징, 음성어워드의 집합(BoAW), DeepSpectrum, auDeep와 통합하였다.
  • BOSARIS 툴킷을 사용하여 로지스틱 회귀를 통해 점수 수준 융합을 수행하였으며, 개발 세트에서 시스템 가중치를 학습하여 테스트 세트의 일반화 성능을 최적화하였다.
  • 각 기준선 시스템의 초모델 하이퍼파라미터를 최적화하고, 튜닝을 통해 최고 성능을 보인 설정을 선택하였으며, 개발 및 테스트 세트에서 결과를 보고하였다.
  • 스펙트로그램과 피크노그램을 사용하여 마스크 착용 및 비착용 음성의 스펙트럼 및 시간적 에너지 동역학을 시각적으로 분석하였다.
  • 무게 조정되지 않은 평균 재현율(UAR)을 사용하여 성능을 평가하였으며, 이는 ComParE 2020에서 균형 잡힌 클래스 성능을 측정하는 주요 지표이다.

실험 결과

연구 질문

  • RQ1선형 필터뱅크 기반 특징(LFCC)은 음성의 마스크 유도 스펙트럼 왜곡을 분류에 효과적으로 포착할 수 있는가?
  • RQ2순간 위상 정보(IFCC)는 스펙트럼 에너지나 에너지 레지스트리 특징에 비해 마스크 착용 음성을 탐지하는 데 얼마나 기여하는가?
  • RQ3일정-Q 변환에서 유도된 장기 스펙트럼 표현(CQCC)은 단기 특징에 비해 마스크 탐지 성능을 어떻게 향상시키는가?
  • RQ4보완적인 음성 특징과 ComParE 2020 기준선의 점수 수준 융합은 개별 시스템이나 다수결보다 분류 성능을 유의미하게 향상시키는가?
  • RQ5LFCC, IFCC, CQCC, MFCC와 같은 다양한 음성 특징이 마스크 착용 음성 분류의 최종 정확도에 기여하는 상대적 기여도는 어떠한가?

주요 결과

  • LFCC는 음성 특징 중에서 가장 높은 개별 성능를 보였으며, 테스트 세트에서 UAR 68.80%를 기록하여 MFCC 및 CQCC를 초월하였다.
  • CQCC는 개발 세트에서 UAR 63.90%, 테스트 세트에서 70.60%를 기록하여 장기 스펙트럼 정보의 가치를 보여주었다.
  • IFCC는 개발 세트에서 UAR 60.31%에 그쳐, 마스크로 인한 위상 변동이 이 작업에 충분히 구별성이 없다는 것을 시사하였다.
  • 네 가지 음성 특징과 네 가지 ComParE 2020 기준선의 점수 수준 융합은 테스트 세트에서 UAR 73.50%를 달성하여 기준선 다수결 기준선(71.80%)을 뛰어넘었다.
  • 점수 수준 융합 전략은 다수결보다 성능을 향상시켰으며, 단순 공명보다 가중치를 부여한 융합의 이점을 입증하였다.
  • 음성 특징과 ComParE 2020 기준선의 융합은 UAR에서 1.70% 향상시켜, 음성 특징과 기능적 특징이 보완적인 성질을 가짐을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.