Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-channel Multi-frame ADL-MVDR for Target Speech Separation

Zhuohuang Zhang, Yong Xu|arXiv (Cornell University)|2020. 12. 24.
Speech and Audio Processing참고 문헌 78인용 수 5
한 줄 요약

이 논문은 순차적 음성 분리 시스템에서 비선형 왜곡과 잔여 노이즈를 크게 줄이고, 음성 품질, 이해도 및 ASR 정확도를 향상시키기 위해 RNN 기반 필터링을 사용하여 신경 마스크 추정과 시간에 따라 변화하는 beamforming 가중치를 공동 최적화하는 다중채널 다중프레임 전면 딥러닝 MVDR(MCMF ADL-MVDR) 프레임워크를 제안한다. 이 방법은 유사한 추론 비용을 유지하면서도 순수 신경망 기반 및 전통적인 신경 마스크 기반 MVDR 시스템을 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Many purely neural network based speech separation approaches have been proposed to improve objective assessment scores, but they often introduce nonlinear distortions that are harmful to modern automatic speech recognition (ASR) systems. Minimum variance distortionless response (MVDR) filters are often adopted to remove nonlinear distortions, however, conventional neural mask-based MVDR systems still result in relatively high levels of residual noise. Moreover, the matrix inverse involved in the MVDR solution is sometimes numerically unstable during joint training with neural networks. In this study, we propose a multi-channel multi-frame (MCMF) all deep learning (ADL)-MVDR approach for target speech separation, which extends our preliminary multi-channel ADL-MVDR approach. The proposed MCMF ADL-MVDR system addresses linear and nonlinear distortions. Spatio-temporal cross correlations are also fully utilized in the proposed approach. The proposed systems are evaluated using a Mandarin audio-visual corpus and are compared with several state-of-the-art approaches. Experimental results demonstrate the superiority of our proposed systems under different scenarios and across several objective evaluation metrics, including ASR performance.

연구 동기 및 목표

  • 순수 신경망 기반 음성 분리 시스템에서 발생하는 비선형 왜곡과 잔여 노이즈가 ASR 성능을 떨어뜨리는 문제를 해결하기 위해.
  • 딥 뉴럴 네트워크와 함께 공동 학습할 때 기존 신경 마스크 기반 MVDR 시스템에서 발생하는 수치적 불안정성 문제를 해결하기 위해.
  • 다중 채널과 프레임 간의 시공간 상관관계를 활용하여 음성 분리 성능을 향상시키기 위해.
  • 저지연성과 고효율성을 확보한 실시간 온라인 처리가 가능한 종단간 훈련 가능한 beamforming 시스템을 개발하기 위해.
  • 음성 품질, 이해도 및 자동 음성 인식 정확도에서 열등한 성능을 달성하기 위해.

제안 방법

  • 딥 뉴럴 네트워크(DNN)를 사용해 시간-주파수 마스크 추정을 수행하고, RNN으로 예측한 beamforming 가중치를 사용하는 학습된 시간에 따라 변화하는 MVDR beamformer를 통합한다.
  • 다중채널 다중프레임(MCMF) 접근 방식을 통해 마이크 어레이와 인접 프레임 간의 공간적 및 시간적 상관관계를 공동으로 모델링한다.
  • GRU-네트워크를 사용해 동적 beamforming 가중치를 예측함으로써 기존 MVDR에서 요구하는 행렬 역행렬 계산과 수치적 불안정성을 피한다.
  • 복소비율 필터링(cRF)을 적용하여 위상과 진폭 성분을 함께 모델링함으로써 분리 정확도를 향상시킨다.
  • 절단 기반 MVDR 방법과 달리, beamforming 가중치의 순차적 갱신을 통해 온라인 스트리밍 호환 추론을 가능하게 한다.
  • 음성 품질과 ASR 성능을 동시에 최적화하기 위해 기울기 가능 손실 함수를 사용해 전체 시스템을 종단간 훈련한다.

실험 결과

연구 질문

  • RQ1신경 마스크 추정과 적응형 beamforming의 공동 학습 프레임워크가 딥러닝 기반 음성 분리에서 비선형 왜곡을 줄일 수 있는가?
  • RQ2다중프레임 및 다중채널의 시공간 상관관계를 통합할 경우 분리 성능 향상과 잔여 노이즈 감소에 어떤 기여를 하는가?
  • RQ3RNN 기반 beamforming 가중치 예측 방식이 신경 마스크 기반 MVDR 시스템에서 발생하는 수치적 불안정 문제를 해결할 수 있는가?
  • RQ4제안된 ADL-MVDR 시스템은 순수 신경망 기반 또는 기존 신경 마스크 기반 MVDR 시스템보다 더 높은 ASR 정확도와 음성 품질을 달성할 수 있는가?
  • RQ5모델 크기를 줄여도 실시간 스트리밍 추론이 가능하면서 높은 성능을 유지할 수 있는가?

주요 결과

  • 모델 크기를 줄인 MC ADL-MVDR(compact) 모델은 모델 크기가 작음에도 불구하고 cRF를 사용한 MVDR 대비 PESQ에서 15% 상대적 향상, Si-SNR에서 27%, WER에서 18% 향상된 성능을 기록했다.
  • 제안된 시스템은 PESQ 3.37, WER 13.01%를 달성하여 cRF를 사용한 MVDR 기준선(PESQ: 2.90, WER: 16.74%)을 능가했으며, 유사한 추론 시간(27.0 ms 대비 31.3 ms)을 유지했다.
  • 모델 크기 증가만으로는 성능 향상이 미미하며(예: 더 큰 DNN 또는 MVDR 시스템), 이는 성능 향상의 핵심이 용량 증가가 아니라 아키텍처 혁신임을 시사한다.
  • RNN 기반 beamformer가 기존 MVDR 시스템이 요구하는 행렬 역행렬 계산 없이 공동 학습 중에도 수치적 불안정성을 피함을 입증했다.
  • 시스템은 낮은 잔여 노이즈와 최소한의 비선형 왜곡을 유지하며, 비교된 모든 방법 중 가장 높은 목적적 평가 점수와 가장 낮은 WER를 기록했다.
  • 절단 기반 MVDR 시스템과 달리, beamforming 가중치의 순차적 갱신 덕분에 효율적인 온라인 처리가 가능해져 스트리밍 입력에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.