Skip to main content
QUICK REVIEW

[논문 리뷰] A Monaural Speech Enhancement Method for Robust Small-Footprint Keyword Spotting

Yue Gu, Zhihao Du|arXiv (Cornell University)|2019. 06. 20.
Speech Recognition and Synthesis참고 문헌 18인용 수 4
한 줄 요약

이 논문은 새로운 복합 순환망(CRN)과 엔드 투 엔드 훈련을 사용하여, 소형 포지션을 갖춘 단일 청취자 음성 강화 방법을 제안한다. 이는 잡음에 강한 키워드 스트링(KWS)을 위한 것이다. 음성 강화 프론트엔드를 CNN 기반 KWS 모델과 통합하고, 백프로파게이션을 통해 양자 모두를 공동으로 최적화함으로써, 특히 멜스펙트로그램 입력에서 잡음에 대한 강건성을 크게 향상시키며, BiLSTM 기반 접근법에 비해 모델 크기와 계산량을 줄였다.

ABSTRACT

Robustness against noise is critical for keyword spotting (KWS) in real-world environments. To improve the robustness, a speech enhancement front-end is involved. Instead of treating the speech enhancement as a separated preprocessing before the KWS system, in this study, a pre-trained speech enhancement front-end and a convolutional neural networks (CNNs) based KWS system are concatenated, where a feature transformation block is used to transform the output from the enhancement front-end into the KWS system's input. The whole model is trained jointly, thus the linguistic and other useful information from the KWS system can be back-propagated to the enhancement front-end to improve its performance. To fit the small-footprint device, a novel convolution recurrent network is proposed, which needs fewer parameters and computation and does not degrade performance. Furthermore, by changing the input features from the power spectrogram to Mel-spectrogram, less computation and better performance are obtained. our experimental results demonstrate that the proposed method significantly improves the KWS system with respect to noise robustness.

연구 동기 및 목표

  • 자원 제한된 장치에서 실제 잡음 환경에서의 키워드 스트링(KWS) 강건성 문제를 해결한다.
  • 대규모 모델이 필요한 다중 조건 훈련의 한계를 극복하여, 소형 포지션 배포에 부적합한 모델을 피한다.
  • 성능을 희생시키지 않은 채 파rameter와 계산량을 줄이는 경량 음성 강화 프론트엔드를 개발한다.
  • 강화와 KWS 모델을 공동으로 훈련시켜 언어 정보가 강화를 이끄는 방식으로 KWS의 강건성을 향상시킨다.
  • 특징 도메인(파wer 스펙트로그램 대비 멜스펙트로그램)이 KWS 작업의 효율성과 성능에 미치는 영향을 조사한다.

제안 방법

  • 계산 비용이 높은 BiLSTM 모델을 대체할 수 있는 경량 음성 강화 프론트엔드로 새로운 복합 순환망(CRN)을 제안한다.
  • 강화 모델을 MFCC로 변환하는 특징 변환 블록을 통해 CNN 기반 KWS 시스템과 통합한다.
  • KWS 시스템의 기울기들이 강화 프론트엔드를 업데이트할 수 있도록, 전체 시스템을 엔드 투 엔드로 공동 최적화하여 훈련한다.
  • 이deal ratio masking(IRM)을 음성 강화 목표로 사용하며, 예측된 마스크와 이상 마스크 간의 평균 제곱 오차(MSE)를 최소화한다.
  • 노이즈가 있는 스펙트로그램과 예측된 마스크를 요소별 곱셈으로 곱하여 강화된 스펙트로그램을 생성한다.
  • KWS 시스템에 멜스펙트로그램을 입력으로 사용하여 성능을 평가함으로써, 파워 스펙트로그램 대비 효율성과 강건성이 향상됨을 보였다.

실험 결과

연구 질문

  • RQ1경량적이고 소형 포지션을 갖춘 음성 강화 모델이 계산 비용을 증가시키지 않고도 잡음 환경에서 키워드 스트링의 강건성을 향상시킬 수 있는가?
  • RQ2강화 모델과 KWS 모델을 공동으로 훈련시키면 별도 훈련 또는 다중 조건 훈련보다 성능이 향상되는가?
  • RQ3Mel-spectrogram이 파워 스펙트로그램보다 KWS 시스템에 더 나은 입력 표현인가?
  • RQ4강화 모델이 키워드의 음소 기호 수에 얼마나 민감한가? 그리고 특징 도메인의 선택이 이 민감도에 영향을 미치는가?
  • RQ5제안된 모델이 훈련 데이터에 포함되지 않은 새로운 잡음 조건에 대해 얼마나 잘 일반화되는가?

주요 결과

  • 공동 훈련 전략은 다중 조건 훈련과 별도 훈련 모두를 크게 능가하여, 일치하는 잡음 조건 하에서 테스트 세트에서 93.17%의 정확도를 달성했다.
  • MelCRN32 모델은 모든 모델 중에서 가장 낮은 가짜 거부율(FRR) 1.19%와 가짜 경고율(FAR) 6.20%를 기록했으며, BiLSTM 및 PowCRN 변종보다 뛰어난 성능을 보였다.
  • 멜스펙트로그램 기반 모델은 주파수 빈도 수를 줄여 계산량을 감소시켰으며, 파워 스펙트로그램 대비 성능을 유지하거나 향상시켰다.
  • 공동 훈련된 MelCRN32 모델은 불일치하는 잡음 조건(100개의 새로운 잡음) 하에서 78.12%의 정확도를 기록했으며, BiLSTM 및 기타 CRN 변종보다 뛰어난 성능을 보였다.
  • 멜스펙트로그램 기반 모델은 키워드의 음소 기호 수에 대해 더 낮은 AUC 감소를 보이며 민감도가 낮아, 파워 스펙트로그램 기반 모델보다 우수한 성능을 보였다.
  • 좁은 모델(MelCRN16 및 PowCRN16)은 훨씬 적은 파라미터와 낮은 계산량으로 전체 크기 모델과 유사한 성능을 달성하여, 소형 포지션 장치에 적합했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.