Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Echo Cancellation and Noise Suppression based on Cascaded Magnitude and Complex Mask Estimation

Xiaofeng Shu, Yehang Zhu|arXiv (Cornell University)|2021. 07. 20.
Speech and Audio Processing참고 문헌 26인용 수 9
한 줄 요약

이 논문은 복소수 시간 컨volution 신경망(MC-TCN)을 제안하여 음향 에코 제거(AEC)와 노이즈 제거(NS)를 동시에 수행한다. 먼저 크기 마스크 추정을 수행한 후, 복소비율 마스크(CRM) 추정을 통해 크기와 위상을 모두 향상시킨다. 이 방법은 INTERSPEECH2021 AEC 챌린지 블라인드 테스트 세트에서 DECMOS 점수 4.41을 기록하여 기준 모델보다 0.54점 높게 성능을 냈다.

ABSTRACT

Acoustic echo and background noise can seriously degrade the intelligibility of speech. In practice, echo and noise suppression are usually treated as two separated tasks and can be removed with various digital signal processing (DSP) and deep learning techniques. In this paper, we propose a new cascaded model, magnitude and complex temporal convolutional neural network (MC-TCN), to jointly perform acoustic echo cancellation and noise suppression with the help of adaptive filters. The MC-TCN cascades two separation cores, which are used to extract robust magnitude spectra feature and to enhance magnitude and phase simultaneously. Experimental results reveal that the proposed method can achieve superior performance by removing both echo and noise in real-time. In terms of DECMOS, the subjective test shows our method achieves a mean score of 4.41 and outperforms the INTERSPEECH2021 AEC-Challenge baseline by 0.54.

연구 동기 및 목표

  • 실세계 환경에서 동시 발생하는 에코와 노이즈 상황에서 별도로 처리하는 AEC 및 NS의 한계를 해결하기 위해.
  • 딥러닝을 활용해 에코와 노이즈 제거를 동시에 모델링하여 음성 품질과 이해도를 향상시키기 위해.
  • 기존 방법보다 우수한 성능을 내며, 단말화 및 병렬 처리가 가능한 경량 아키텍처를 개발하기 위해.
  • 실시간 추론 능력을 유지하면서도 음성 왜곡과 잔여 에코를 최소화하기 위해.

제안 방법

  • MC-TCN 모델은 이중 단계 계단식 아키텍처를 사용한다: 첫 번째 단계에서는 크기 TCN이 입력 스펙트로그램에서 크기 마스크를 추정한다.
  • 추정된 크기 마스크는 원본 위상과 조합되어 두 번째 단계의 복소수 입력을 형성한다.
  • 두 번째 단계는 복소수 값 TCN을 사용하여 복소비율 마스크(CRM)를 추정하여 크기 및 위상 향상의 공동 최적화를 달성한다.
  • 확장된 컨volution을 사용한 시간 컨볼루션 네트워크(TCN)는 수신 필드를 확장하고 장거리 의존성을 효율적으로 모델링한다.
  • 신호 근사에 최적화된 손실 함수를 사용해 엔드 투 엔드로 모델을 훈련시켜 강력한 특징 학습을 가능하게 한다.
  • 실시간에서의 에코 경로 추정 및 제거를 위해 적응형 필터를 시스템에 통합하여 에코 제거 성능을 향상시켰다.

실험 결과

연구 질문

  • RQ1계단식 딥러닝 아키텍처가 별도의 처리 파이프라인보다 에코와 노이즈를 더 효과적으로 억제할 수 있는가?
  • RQ2크기 마스크 추정 후 복소수 마스크 추정을 수행할 경우 음성 향상 성능가 어떻게 향상되는가?
  • RQ3TCN 기반 모델이 실시간 AEC 및 NS 작업에서 LSTM과 같은 순환 네트워크를 얼마나 뛰어나게 성능을 내는가?
  • RQ4모델의 깊이(블록 수)가 음성 품질 및 에코 제거에 어떤 영향을 미치는가?
  • RQ5근거리 및 원거리 음성 모두 활성화된 더블톡 조건에서 제안된 방법의 성능은 어떠한가?

주요 결과

  • 제안된 MC-TCN 모델은 INTERSPEECH2021 AEC-Challenge 블라인드 테스트 세트에서 DECMOS 점수 4.41을 기록하여 전체 3위를 차지했다.
  • 기준 모델 대비 0.54 DECMOS 포인트 향상되어 청각적 음성 품질 향상이 뚜렷하게 확인되었다.
  • 더블톡 상황에서 모델은 열악한 음성에 대해 DECMOS 3.286, 에코 MOS에 대해 3.968을 기록하여 뛰어난 강건성을 입증했다.
  • 20개 블록(B=20)을 가진 모델가 에코 제거와 음성 품질 간 최적의 균형을 확보하여 B=10 및 B=15 구성보다 뛰어난 성능을 보였다.
  • 맥북 프로에서 1프레임당 추론 시간이 0.7460ms에 불과하여 실시간 적용 가능성은 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.