Skip to main content
QUICK REVIEW

[논문 리뷰] Noise Robust IOA/CAS Speech Separation and Recognition System For The Third 'CHIME' Challenge

Xiaofei Wang, Chao Wu|arXiv (Cornell University)|2015. 09. 21.
Speech and Audio Processing참고 문헌 8인용 수 6
한 줄 요약

이 논문은 제3차 CHiME 챌린지용 소음에 강한 음성 분리 및 인식 시스템을 제안한다. 전처리 단계로 음성 왜곡 가중 다중채널 위너 필터(SDW-MWF)를 사용하고, 후처리 단계로 딥 뉴럴 네트워크(DNN, CNN, LSTM)와 레이스 투표 재정렬(lattice rescoring)을 적용하였다. 이 시스템은 실제 테스트 데이터에서 13.2%의 WER를 달성하여 최고의 GMM 기반 시스템(33.23%) 대비 60.9%의 상대적 WER 감소를 이룩하였다.

ABSTRACT

This paper presents the contribution to the third 'CHiME' speech separation and recognition challenge including both front-end signal processing and back-end speech recognition. In the front-end, Multi-channel Wiener filter (MWF) is designed to achieve background noise reduction. Different from traditional MWF, optimized parameter for the tradeoff between noise reduction and target signal distortion is built according to the desired noise reduction level. In the back-end, several techniques are taken advantage to improve the noisy Automatic Speech Recognition (ASR) performance including Deep Neural Network (DNN), Convolutional Neural Network (CNN) and Long short-term memory (LSTM) using medium vocabulary, Lattice rescoring with a big vocabulary language model finite state transducer, and ROVER scheme. Experimental results show the proposed system combining front-end and back-end is effective to improve the ASR performance.

연구 동기 및 목표

  • 레스토랑, 버스, 거리와 같은 실생활 소음 환경에서 자동 음성 인식(ASR) 성능을 향상시키기 위해.
  • 최적화된 전처리 단계를 통해 다중채널 음성 강화에서 소음 감소와 음성 왜곡 간의 상충 관계를 최적화하기 위해.
  • 대규모 어휘 어휘 모델을 사용한 레이스 투표 재정렬과 함께 딥 러닝 모델(DNN, CNN, LSTM)을 통해 후처리 단계의 ASR 강인성을 향상시키기 위해.
  • 실제 소음 환경에서 제3차 CHiME 음성 분리 및 인식 챌린지에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 소음 감소와 음성 왜곡 간의 상충 관계를 최적화하기 위해 조정 가능한 파rameter μ를 사용하여 목표 음성 신호를 추정하기 위해 음성 왜곡 가중 다중채널 위너 필터(SDW-MWF)를 적용하였다.
  • 최적화 기준을 사용하여 SDW-MWF 필터를 유도하였으며, 이는 기댓값의 최소화를 포함한다: E{|w^H y - X1|^2 + μ|w^H n|^2}를 최소화하는 것.
  • 학습 및 테스트 데이터 모두에 SDW-MWF를 적용하여 학습과 테스트 조건 간의 불일치를 줄였으며, 데이터 증강을 위해 무작위 SNR 변동(-6dB에서 +6dB)을 사용하였다.
  • 엔드 투 엔드 음성 모델링을 위해 DNN, CNN, LSTM 음향 모델을 사용하였으며, DNN와 CNN이 GMM 기반 기준보다 뛰어난 성능을 보였다.
  • 대규모 어휘 유한 상태 전이기반 언어 모델을 사용하여 레이스 투표 재정렬을 구현하여 가설 출력을 보완하였다.
  • ROVER(Recognition Output Voting Error Reduction) 기법을 사용하여 다수의 시스템 출력을 융합하여 최종 인식 정확도를 향상시켰다.

실험 결과

연구 질문

  • RQ1다중채널 음성 강화에서 소음 감소와 음성 왜곡 간의 상충 관계를 어떻게 최적화할 수 있는가?
  • RQ2기존의 GMM-HMM 시스템에 비해 딥 뉴럴 네트워크(DNN, CNN, LSTM)는 소음이 많고 반향이 있는 환경에서 얼마나 ASR 성능을 향상시키는가?
  • RQ3대규모 어휘 언어 모델을 사용한 레이스 투표 재정렬은 소음이 많은 음성 인식에서 단어 오류율(WER)을 추가로 감소시킬 수 있는가?
  • RQ4ROVER를 통해 다수의 신경망 기반 시스템을 융합하면 실생활 테스트 세트에서 전체 ASR 성능이 어떻게 향상되는가?

주요 결과

  • SDW-MWF 전처리 단계는 GMM 모델 기반에서 실제 테스트 데이터에서 WER를 37.36%에서 23.19%로 감소시켜 소음 억제 효과를 뚜렷이 보였으며, 왜곡은 통제된 수준을 유지하였다.
  • sMBR 학습을 사용한 DNN와 무작위 SNR 데이터 증강을 적용하여 실제 테스트 데이터에서 WER를 18.4%로 감소시켜 소음 환경에서의 딥 러닝의 효과를 입증하였다.
  • CNN 기반 음향 모델은 WER를 17.87%로 추가로 감소시켰고, LSTM은 18.96%의 WER를 기록하여 순환 및 합성곱 네트워크가 시간적 및 주파수적 특징을 더 잘 모델링할 수 있음을 보여주었다.
  • 레이스 투표 재정렬은 DNN+sMBR 기반에서 WER를 18.4%에서 15.3%로, CNN+sMBR 기반에서 17.87%에서 16.37%로 감소시켜 ASR 출력을 보완하는 데 효과적임을 입증하였다.
  • 최종 시스템은 레이스 투표 재정렬을 적용한 DNN, CNN, LSTM 시스템의 ROVER 융합을 통해 실제 테스트 데이터에서 WER 13.2%를 달성하였으며, 이는 최고의 GMM 기반 기준(33.23%) 대비 60.9%의 상대적 감소를 의미한다.
  • 최고의 단일 시스템(DNN+sMBR + 레이스 투표 재정렬)은 버스 시나리오에서 17.74%의 WER, 카페에서는 11.75%, 산책로에서는 13.34%, 도로 교차로에서는 9.96%의 WER를 기록하여 다양한 환경에서 뛰어난 강인성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.