Skip to main content
QUICK REVIEW

[논문 리뷰] Noise-Robust ASR for the third 'CHiME' Challenge Exploiting Time-Frequency Masking based Multi-Channel Speech Enhancement and Recurrent Neural Network

Zaihu Pang, Fengyun Zhu|arXiv (Cornell University)|2015. 09. 24.
Speech and Audio Processing참고 문헌 20인용 수 9
한 줄 요약

이 논문은 모바일 기기에서 촬영한 다중채널 음성 신호를 활용하여 실생활 환경에서의 소음에 강건한 자동 음성 인식(ASR) 시스템을 제안한다. 이 시스템은 다중채널 세기의 제곱상관관계(MSC) 기반 시간-주파수 마스킹과 위상 차이 측정(PDM)을 활용한 음성 강화 기법을, 순환 신경망(RNN) 기반 음성 모델 및 판별적 훈련과 결합한다. 실생활 테스트 데이터에서 최고의 베이스라인 대비 57%의 상대적 단어오류률(WER) 감소를 달성하였으며, 레이티스 조합 및 RNN 기반 재평가를 통해 최종 WER는 14.28%에 도달하였다.

ABSTRACT

In this paper, the Lingban entry to the third 'CHiME' speech separation and recognition challenge is presented. A time-frequency masking based speech enhancement front-end is proposed to suppress the environmental noise utilizing multi-channel coherence and spatial cues. The state-of-the-art speech recognition techniques, namely recurrent neural network based acoustic and language modeling, state space minimum Bayes risk based discriminative acoustic modeling, and i-vector based acoustic condition modeling, are carefully integrated into the speech recognition back-end. To further improve the system performance by fully exploiting the advantages of different technologies, the final recognition results are obtained by lattice combination and rescoring. Evaluations carried out on the official dataset prove the effectiveness of the proposed systems. Comparing with the best baseline result, the proposed system obtains consistent improvements with over 57% relative word error rate reduction on the real-data test set.

연구 동기 및 목표

  • 모바일 기기에서의 다중채널 오디오를 활용하여 실생활 소음 환경에서의 강건한 ASR 시스템을 개발한다.
  • 고도화된 음성 강화 기법과 딥러닝 기법을 통합하여 소음이 많고 반향이 심한 조건에서의 음성 인식 성능을 향상시킨다.
  • 모바일 기기에서의 마이크 응답 불일치 문제를 적응형 자기보정 기법을 통해 해결한다.
  • 레이티스 조합 및 재평가를 통한 다중 인식 시스템의 조합을 통해 정확도를 향상시킨다.

제안 방법

  • 시간-주파수 마스킹 프론트엔드는 다중채널 세기의 제곱상관관계(MSC)를 활용해 산산이 흩어진 소음을 억제하고, 위상 차이 측정(PDM)을 통해 방향성 간섭을 억제한다.
  • 시스템은 마이크로폰 응답 불일치를 보정하기 위해 적응형 마이크로폰 어레이 자기보정 방법을 사용한다.
  • 상태공간 최소 베이즈 위험(sMBR) 판별적 훈련을 사용하여 LSTMP 및 마크스아웃 네트워크를 포함한 순환 신경망(RNN) 음성 모델을 훈련한다.
  • 특징으로는 fMLLR 변환된 MFCC 및 온라인 i-벡터를 사용하여 발화자, 채널 및 소음 조건을 모델링한다.
  • 언어 모델링은 4-그램 모델에 Kneser-Ney 스무딩을 적용하고, 두 번째 단계 재평가를 위해 RNN-최대 엔트로피(RNNME) 모델을 사용한다.
  • 최종 인식 결과는 다수의 시스템 출력을 레이티스 조합하여 확보되며, 이는 강건성과 정확도 향상에 기여한다.

실험 결과

연구 질문

  • RQ1MSC 및 PDM 기반 시간-주파수 마스킹이 실생활 다중채널 녹음에서의 소음을 억제하는 데 얼마나 효과적인가?
  • RQ2sMBR 훈련을 적용한 RNN 기반 음성 모델이 소음이 많고 원거리에서의 ASR에서 WER를 얼마나 향상시킬 수 있는가?
  • RQ3i-벡터와 fMLLR 특징의 통합이 발화자 및 채널 변동성에 대한 강건성을 어떻게 향상시키는가?
  • RQ4레이티스 조합 및 RNNME 모델을 활용한 다단계 재평가가 개별 시스템 성능을 초월해 WER를 추가로 감소시킬 수 있는가?

주요 결과

  • 제안된 음성 강화 프론트엔드는 향상된 데이터에서 기준 대비 12.81%의 절대적 WER 감소를 달성하였다.
  • 최고의 성능을 보인 시스템은 LSTMP+sMBR 음성 모델링, RNNME 재평가 및 레이티스 조합을 통합하여 실테스트 세트에서 최종 WER 14.28%를 달성하였다.
  • 실생활 데이터에서 최고의 베이스라인 대비 57% 이상의 상대적 WER 감소를 달성하였으며, 시뮬레이션 데이터에서는 42%의 감소를 기록하였다.
  • fMLLR 특징과 i-벡터의 조합은 모든 구성에서 Fbank 특징 대비 일관되게 성능 향상을 이끌었다.
  • sMBR 판별적 훈련은 모든 음성 모델에서 일관된 WER 향상을 이끌었으며, LSTMP+sMBR 모델이 마크스아웃 기반 모델보다 우수한 성능을 보였다.
  • 상위 두 시스템(LSTMP+sMBR 및 Maxout+dp+sMBR)의 레이티스 조합에 RNNME 재평가를 적용한 결과가 가장 우수한 전반적 성능을 보였으며, 앙상블 방법의 효과성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.