Skip to main content
QUICK REVIEW

[논문 리뷰] Nonlinear Residual Echo Suppression Based on Multi-stream Conv-TasNet

Hongsheng Chen, Teng Xiang|arXiv (Cornell University)|2020. 05. 15.
Speech and Audio Processing참고 문헌 23인용 수 4
한 줄 요약

이 논문은 선형 AEC 시스템의 잔여 신호와 적응 필터 출력을 이중 입력 스트림으로 활용하여 다중 스트림 Conv-TasNet 기반 잔여 에코 제거(RES) 방법을 제안한다. 다중 입력 컨volution 블록과 지수적 레이어 정규화를 통합함으로써, 단말통화 및 이중통화 상황에서 모두 뛰어난 성능을 달성하였으며, 이중통화 조건에서 45 dB 이상의 ERLE와 13 dB 초과의 SDR 향상을 기록하였다.

ABSTRACT

Acoustic echo cannot be entirely removed by linear adaptive filters due to the nonlinear relationship between the echo and far-end signal. Usually a post processing module is required to further suppress the echo. In this paper, we propose a residual echo suppression method based on the modification of fully convolutional time-domain audio separation network (Conv-TasNet). Both the residual signal of the linear acoustic echo cancellation system, and the output of the adaptive filter are adopted to form multiple streams for the Conv-TasNet, resulting in more effective echo suppression while keeping a lower latency of the whole system. Simulation results validate the efficacy of the proposed method in both single-talk and double-talk situations.

연구 동기 및 목표

  • 선형 음향 에코 제거(LAEC)가 비선형 에코 경로를 처리하는 데 한계를 가짐을 해결하기 위해.
  • 기존 RES 방법에서 잔여 에코 제거와 근접 음성 왜곡 사이의 상충 관계를 극복하기 위해.
  • 딥 러닝을 활용해 잔여 에코 제거에서 복잡한 비선형 관계를 모델링하기 위해.
  • 적응 필터 출력으로부터 보조 정보를 활용하여 음성 품질 향상과 에코 제거 성능을 향상시키기 위해.
  • 주파수 도메인 및 순환 신경망 기반 접근 방식보다 뛰어난 성능을 보이는 저지연, 엔드 투 엔드 타임 도메인 솔루션을 개발하기 위해.

제안 방법

  • LAEC 잔여 신호 $s_{\text{AEC}}(n)$ 와 적응 필터 출력 $\hat{d}(n)$ 를 이중 입력 스트림으로 처리할 수 있도록 Conv-TasNet 아키텍처를 변형한다.
  • 시간 컨volution 네트워크(TCN)에 다중 입력 컨볼루션(MI Conv) 블록을 도입하여 양쪽 입력 스트림의 특징을 함께 모델링한다.
  • 누적 레이어 정규화(cLN)를 지수적 레이어 정규화(eLN)로 교체하여 학습 안정성 향상과 일반화 성능 향상을 도모한다.
  • 표준 음성 분離에서의 채널 균형을 깨뜨리기 위해, 근접 음성 복구 강조 및 잔여 에코 억제를 목표로 한 학습 목적 함수를 수정한다.
  • 1D 컨볼루션 인코더를 사용해 웨이브폼을 임베딩으로 매핑하고, TCN 기반의 제거 모듈을 거친 후, 역방향 컨볼루션 디코더를 통해 웨이브폼 재구성한다.
  • STFT 기반 방법에서 흔히 발생하는 위상 재구성 문제를 피하기 위해, 음성 품질과 에코 제거를 최적화한 손실 함수를 사용해 엔드 투 엔드 학습을 수행한다.

실험 결과

연구 질문

  • RQ1LAEC 잔여 신호와 적응 필터 출력을 이중 스트림으로 조합함으로써, 단일 스트림 모델 대비 잔여 에코 제거 성능 향상이 가능한가?
  • RQ2다중 입력 컨볼루션 블록의 통합이 비선형 잔여 에코를 효과적으로 억제하면서 근접 음성 품질을 유지하는 데 기여하는가?
  • RQ3기존의 전통적 RES 방법들(FCN, BLSTM 등)과 비교해 본다면, 에코 감쇠 및 음성 품질 지표에서 어떤 성능 차이를 보이는가?
  • RQ4비인과적 RNN 기반 접근 방식(예: BLSTM)에 비해, 제안된 방법은 얼마나 낮은 지연을 달성하는가?
  • RQ5이중통화 상황에서 에코 대 음성 에너지 비율이 높을 경우, 표준 Conv-TasNet 대비 수정된 Conv-TasNet 아키텍처가 더 뛰어난 성능을 내는가?

주요 결과

  • 제안된 다중 스트림 Conv-TasNet(TasNet-MI)는 단말통화 조건에서 음성 및 음악 모두에 대해 45 dB 이상의 에코 복귀 손실 향상(ERLE)을 기록하였으며, FCN(16.55 dB)과 BLSTM(음성 기준 51.67 dB)을 크게 능가하였다.
  • 에코 대 음성 에너지 비율(SER)이 -14.2 dB인 이중통화 조건에서 TasNet-MI는 음성에 대해 PESQ 2.80, SDR 13.8 dB를 달성하였으며, TasNet-L(PESQ: 2.71, SDR: 12.6 dB)과 TasNet-O(PESQ: 2.57, SDR: 11.7 dB)를 모두 능가하였다.
  • 음악 원격 신호의 SER이 -18.2 dB일 경우, TasNet-MI는 STOI 0.820을 기록하여 TasNet-L(0.800)과 TasNet-O(0.773)를 초월하였으며, 이는 음성 이해도 향상을 시사한다.
  • 완전히 컨volution형이며 인과적인 아키텍처를 유지함으로써 낮은 지연을 유지하였으며, 비인과적 BLSTM 기반 방법의 높은 지연을 피할 수 있었다.
  • MI Conv 블록과 eLN의 추가로 이중통화 음성 조건에서 TasNet-O 대비 1.1 dB, TasNet-L 대비 2.2 dB의 SDR 향상을 기록하였다.
  • 이중통화 음성 조건에서 LAEC 전용 처리 대비 13.8 dB의 SDR 향상을 달성하여, 근접 음성 품질을 손상시키지 않은 채 효과적인 에코 제거를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.