Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Scale Attention Neural Network for Acoustic Echo Cancellation

Lu Ma, Song Yang|arXiv (Cornell University)|2021. 05. 31.
Speech and Audio Processing참고 문헌 30인용 수 6
한 줄 요약

이 논문은 원거리 및 근거리 신호의 다중 척도 스펙트로그램 특징을 추출하기 위해 확장된 컨볼루션을 사용하는 1D 시간 컨volution 네트워크(TCN)를 사용하는 종단간 다중 척도 주의 신경망을 제안한다. 주의 메커니즘은 다양한 수신 필드 척도에 걸쳐 특징을 동적으로 가중하여 비선형 왜곡, 배경 잡음 및 더블 토크에 대한 강건성을 향상시킨다. 이 방법은 비선형 및 소음 환경을 포함한 도전적인 실세계 조건에서 최신 기술 수준의 성능을 달성한다. ERLE는 최대 58.53 dB, PESQ는 최대 1.76 향상된 점수를 기록한다.

ABSTRACT

Acoustic Echo Cancellation (AEC) plays a key role in speech interaction by suppressing the echo received at microphone introduced by acoustic reverberations from loudspeakers. Since the performance of linear adaptive filter (AF) would degrade severely due to nonlinear distortions, background noises, and microphone clipping in real scenarios, deep learning has been employed for AEC for its good nonlinear modelling ability. In this paper, we constructed an end-to-end multi-scale attention neural network for AEC. Temporal convolution is first used to transform waveform into spectrogram. The spectrograms of the far-end reference and the near-end mixture are concatenated, and fed to a temporal convolution network (TCN) with stacked dilated convolution layers. Attention mechanism is performed among these representations from different layers to adaptively extract relevant features by referring to the previous hidden state in the encoder long short-term memory (LSTM) unit. The representations are weighted averaged and fed to the encoder LSTM for the near-end speech estimation. Experiments show the superiority of our method in terms of the echo return loss enhancement (ERLE) for single-talk periods and the perceptual evaluation of speech quality (PESQ) score for double-talk periods in background noise and nonlinear distortion scenarios.

연구 동기 및 목표

  • 실세계 AEC 응용에서 비선형 왜곡, 배경 잡음 및 마이크로폰 클립핑을 다루는 데에 한계가 있는 선형 적응 필터의 문제점을 해결하기 위해.
  • 기존 방법이 실패하는 더블 토크 및 비선형 음향 환경에서 에코 제거 성능을 향상시키기 위해.
  • 다양한 시간적 및 주파수적 특징을 강건한 에코 제거를 위해 캡처하는 종단간 딥 러닝 프레임워크를 개발하기 위해.
  • 다양한 수신 필드를 가진 확장 컨볼루션 레이어 간에 주의 메커니즘을 통합하여 특징 표현을 향상시키기 위해.
  • 합성 및 실세계 임펄스 응답, 다양한 음향 환경에서 측정된 RIR을 포함하여 일반화 능력을 검증하기 위해.

제안 방법

  • 원시 웨이브폼을 고해상도 스펙트로그램으로 변환하기 위해 1D 시간 컨볼루션을 적용하며, STFT와 유사하지만 학습 가능한 필터를 사용한다.
  • 원거리 참조 및 근거리 혼합 스펙트로그램을 연결하여 스택된 확장 컨볼루션을 가진 TCN에 입력하여 다중 척도 시간적 특징을 캡처한다.
  • 다양한 확장 컨볼루션 레이어의 특징 표현에 주의 메커니즘을 적용하며, 인코더 LSTM의 이전 은닉 상태를 사용해 특징 가중치를 안내한다.
  • 가중 특징 표현을 합산하고 인코더 LSTM을 통해 근거리 음성 신호를 추정한다.
  • 디코더는 역방향 1D 컨볼루션을 사용하여 마스크된 특징에서 향상된 웨이브폼을 재구성한다.
  • 전체 네트워크는 에코 제거 및 음성 품질 최적화를 위한 손실 함수로 종단간으로 훈련된다.

실험 결과

연구 질문

  • RQ1비선형 왜곡과 배경 잡음이 존재하는 상황에서 다중 척도 주의 메커니즘이 AEC 성능을 향상시킬 수 있는가?
  • RQ2증가하는 수신 필드를 가진 확장 컨볼루션 레이어 간의 주의 메커니즘이 에코 제거를 위한 특징 표현을 어떻게 향상시키는가?
  • RQ3제안된 종단간 프레임워크가 더블 토크 및 비선형 상황에서 기존의 적응 필터 및 이전 딥 러닝 방법보다 뛰어난 성능을 보일 수 있는가?
  • RQ4합성 RIR로 훈련하고 실측 RIR로 테스트했을 때 모델의 일반화 능력은 얼마나 우수한가?
  • RQ5반복 시간과 SNR 수준을 변화시켰을 때 모델의 강건성 및 성능에 미치는 영향은 무엇인가?

주요 결과

  • 비선형 환경에서 제안된 방법은 3.5 dB SER를 기록하며 ERLE가 58.53 dB에 도달하여 AES+RES(16.76 dB) 및 Multitask(61.79 dB) 기준선을 크게 능가한다.
  • 배경 잡음이 있는 더블 토크 조건에서 모델은 ΔPESQ 1.76의 향상을 기록하며, AES+RES(0.93) 및 Multitask(1.04)를 초월한다.
  • 소음 환경(10 dB SNR)에서 모델은 ERLE 52.99 dB 및 ΔPESQ 1.53를 기록하며, Multitask(46.12 dB ERLE, 0.70 ΔPESQ)를 능가한다.
  • 아헨 데이터베이스의 실측 RIR에서 모델은 'corridor' 테스트 환경에서 ERLE 55.74 dB 및 ΔPESQ 1.46를 기록하며, AES+RES(12.16 dB ERLE, 0.57 ΔPESQ)를 초월한다.
  • 합성 RIR로 훈련하고 실측 'corridor' RIR로 테스트했을 때 모델은 ΔPESQ 1.18–1.27 향상을 기록하며, 선형 및 비선형 모델 모두에서 CAD-AEC를 능가한다.
  • 모델은 비선형 모델링 능력이 뛰어나 비선형 RIR에서 ERLE 38.63 dB를 기록하며, CAD-AEC의 19.08 dB보다 높지만 선형 RIR에서는 약간 낮은 ERLE를 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.