Skip to main content
QUICK REVIEW

[논문 리뷰] NeuralEcho: A Self-Attentive Recurrent Neural Network For Unified Acoustic Echo Suppression And Speech Enhancement

Meng Yu, Yong Xu|arXiv (Cornell University)|2022. 05. 20.
Speech and Audio Processing인용 수 5
한 줄 요약

NeuralEcho는 음향 에코 제거와 음성 강화를 통합하기 위해 교차 채널 이차 통계 및 다중 헤드 어텐션을 활용한 자기주의적 순환 신경망을 제안한다. 이는 에코, 잡음 및 대상 음성의 동적 특성을 모델링함으로써 음성 품질, 인식 정확도 및 모델 효율성에서 최신 기술을 초월하며, F-T-LSTM보다 상대적으로 WER을 9.1% 감소시키고 SI-SDR를 13.7% 향상시키면서도 더 작은 모델을 사용한다.

ABSTRACT

Acoustic echo cancellation (AEC) plays an important role in the full-duplex speech communication as well as the front-end speech enhancement for recognition in the conditions when the loudspeaker plays back. In this paper, we present an all-deep-learning framework that implicitly estimates the second order statistics of echo/noise and target speech, and jointly solves echo and noise suppression through an attention based recurrent neural network. The proposed model outperforms the state-of-the-art joint echo cancellation and speech enhancement method F-T-LSTM in terms of objective speech quality metrics, speech recognition accuracy and model complexity. We show that this model can work with speaker embedding for better target speech enhancement and furthermore develop a branch for automatic gain control (AGC) task to form an all-in-one front-end speech enhancement system.

연구 동기 및 목표

  • 비선형 에코, 에코 경로 변화 및 비정상적인 잡음을 다루는 데에 한계가 있는 전통적인 적응형 필터링 및 하이브리드 AEC 시스템의 문제점을 해결한다.
  • 음향 에코 제거(AEC)와 음성 강화를 하나의 딥러닝 프레임워크로 통합하여 내성적이고 종단 간 최적화를 향상시킨다.
  • 동일한 모델 내에서 자동 이득 제어(AGC)와 대상 화자 강화를 공동으로 학습함으로써 음성 인식 정확도를 향상시킨다.
  • 마이크, AEC 출력 및 에코 추정 채널 간의 이차 통계를 활용하여 에코/잡음 제거 및 대상 음성 보존을 향상시킨다.
  • 화자 임베딩과 AGC를 조건 입력으로 통합하여 실시간 통신에서 대상 화자 분리 및 출력 음량 일관성 향상을 도모한다.

제안 방법

  • 두 단계 종단 간 모델을 제안: 먼저 에코와 AEC 출력을 추정하고, 그 다음 추정된 이차 통계(공분산 행렬)를 바탕으로 음성 강화 필터를 예측한다.
  • 시간에 걸친 다중 헤드 어텐션을 활용한 자기주의적 RNN을 적용하여 에코 추정, AEC 출력 및 마이크 입력 채널 간의 관련 특징을 동적으로 강조한다.
  • 특징별 선형 조절(FiLM)을 사용해 화자 임베딩 벡터로 네트워크를 조건화함으로써 간섭 신호로부터 대상 음성을 더 잘 분리할 수 있도록 한다.
  • 전처리 AGC 및 후처리 AGC 출력을 모두 예측하는 AGC 브랜치를 공동 학습하는 기법을 도입하여 증폭된 신호가 높은 이해 가능성과 낮은 왜곡을 유지하도록 보장한다.
  • 입력 신호를 주파수 도메인으로 변환하고 시간-주파수 동적 특성을 모델링하기 위해 학습 가능한 필터를 적용하며, 어텐션 메커니즘을 통해 시간적 종속성을 강화한다.
  • 청결한 대상 음성에 대한 지도 학습 손실을 사용해 종단 간으로 모델을 훈련시키며, AEC, 강화 및 AGC 목표를 공동 최적화한다.

실험 결과

연구 질문

  • RQ1기존 하이브리드 또는 두 단계 방법보다 통합된 딥러닝 프레임워크가 음향 에코와 배경 잡음을 더 효과적으로 억제할 수 있는가?
  • RQ2다양한 신호 채널 간의 이차 통계를 모델링함으로써 에코 및 잡음 억제 성능이 어떻게 향상되는가?
  • RQ3화자 임베딩을 통합함으로써 소음이 많고 에코가 있는 환경에서 대상 음성 분리 성능이 얼마나 향상되는가?
  • RQ4메인 강화 네트워크와 함께 AGC를 공동으로 훈련시키는 것이 후처리 AGC보다 더 나은 음성 인식 성능을 낼 수 있는가?
  • RQ5자기주의적 RNN 아키텍처가 표준 RNN 또는 LSTMs보다 복잡한 시간 동적 특성을 더 잘 포착할 수 있는가?

주요 결과

  • NeuralEcho는 더 작은 모델 크기임에도 불구하고 F-T-LSTM보다 SI-SDR에서 13.7% 상대적 향상, PESQ에서 3.5%, WER에서 9.1% 개선하여 최신 기술을 초월한다.
  • 화자 인식 버전의 NeuralEcho는 SI-SDR 11.98 dB, PESQ 2.99, WER 14.06%를 기록하여 대상 음성 분리 성능 향상을 입증한다.
  • 통합된 AGC 브랜치를 갖춘 NeuralEcho 모델은 후처리 AGC 출력에서 WER 13.63%를 기록하여 F-T-LSTM 대비 16.8% 상대적 감소를 달성한다.
  • NeuralEcho와 함께 AGC 브랜치를 공동으로 훈련시키면 WER 13.63%를 달성하며, 후처리 AGC(14.75%)나 AGC 처리 데이터로 훈련한 경우(16.53%)보다 유의미하게 향상되어 종단 간 최적화의 이점이 입증된다.
  • 통합 모델의 전-AGC 출력은 가장 높은 PESQ와 WER 성능를 기록하여 AGC 통합이 핵심 강화 품질을 떨어뜨리지 않고도 인식 성능을 향상시킨다는 것을 시사한다.
  • AGC와 화자 임베딩을 함께 훈련한 모델이 가장 뛰어난 종합 성능을 기록하여 실시간 통신 시스템을 위한 통합 프론트엔드 처리의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.