Skip to main content
QUICK REVIEW

[논문 리뷰] Residual acoustic echo suppression based on efficient multi-task convolutional neural network

Xinquan Zhou, Yanhong Leng|arXiv (Cornell University)|2020. 09. 29.
Speech and Audio Processing참고 문헌 21인용 수 6
한 줄 요약

이 논문은 단일 CPU에서 실시간 요율 0.05로 작동하며, 위상 민감성 마스크와 더불어 더블톡 상태를 동시에 예측하는 효율적인 다중 작업 컨volution 신경망(CNN)을 사용해 실시간 잔류 음향 에코 제거(RAES) 방법을 제안한다. 새로운 억제 손실 함수를 도입해 음향 에코 억제와 근거리 신호 보존을 균형 있게 조절함으로써, 40 dB 이상의 ERLE와 뛰어난 PESQ/STOI 점수를 달성한다. 이는 개인용 기기에서의 구현 가능성을 보장한다.

ABSTRACT

Acoustic echo degrades the user experience in voice communication systems thus needs to be suppressed completely. We propose a real-time residual acoustic echo suppression (RAES) method using an efficient convolutional neural network. The double talk detector is used as an auxiliary task to improve the performance of RAES in the context of multi-task learning. The training criterion is based on a novel loss function, which we call as the suppression loss, to balance the suppression of residual echo and the distortion of near-end signals. The experimental results show that the proposed method can efficiently suppress the residual echo under different circumstances.

연구 동기 및 목표

  • 기존 AEC에서 비선형 음향 에코 성분이 제거되지 않은 후속 잔류 음향 에코 품질 저하 문제를 해결하기 위해.
  • 기존 AEC 시스템의 비선형 프로세서에서 주로 발생하는 더블톡 기간 동안의 근거리 음성 왜곡을 줄이기 위해.
  • 스마트폰 및 노트북과 같은 자원 제약이 있는 개인 기기에서 구동 가능한 계산 비용이 낮은 딥 러닝 모델을 개발하기 위해.
  • 다중 작업 학습 프레임워크에서 더블톡 감지를 보조 작업으로 활용해 마스크 예측 정확도를 향상시키기 위해.
  • 새로운 억제 손실 함수를 통해 음향 에코 억제와 음성 품질 보존 간 균형을 조절하기 위해.

제안 방법

  • 계산 비용을 줄이면서도 성능을 유지하기 위해, MobileNetV2 기반의 CNN 아키텍처와 깊이 분리형 컨볼루션을 사용한다.
  • 입력 특징은 원거리 신호의 로그 스펙트로그램과 적응 필터 출력 오차 신호를 20프레임에 걸쳐 연결하여 시간적 맥락을 제공한다.
  • 다중 작업 학습 설정을 적용: 주된 분기에서는 음향 에코 억제를 위한 위상 민감성 마스크(PSM)를 예측하고, 보조 분기에서는 조건부 어텐션 메커니즘을 사용해 더블톡 상태를 추정한다.
  • 새로운 억제 손실 함수를 도입해 음향 에코 억제와 근거리 신호 왜곡 간 균형을 조절하며, 조정 가능한 억제 비율 α를 포함한다.
  • 위상 정보를 보존하기 위해 위상 민감성 마스크를 타겟으로 사용함으로써 청취 품질을 향상시킨다.
  • 모델은 Adam 옵timizer를 사용해 학습되며, 학습률 0.003, 배치 크기 1024로 설정되며, 특징은 정규화되고 제곱근 헨닝 창을 사용해 윈도잉된다.

실험 결과

연구 질문

  • RQ1다중 작업 딥 러닝 프레임워크는 근거리 음성 왜곡을 최소화하면서도 잔류 음향 에코 억제 성능을 향상시킬 수 있는가?
  • RQ2보조 작업으로 더블톡 감지기를 통합함으로써, 어려운 음향 환경에서 위상 민감성 마스크 예측 정확도가 향상되는가?
  • RQ3경량 CNN 아키텍처는 음향 에코 억제나 음성 품질을 희생시키지 않고도 표준 개인 기기에서 실시간 성능을 달성할 수 있는가?
  • RQ4제안된 억제 손실 함수는 다양한 신호 대 음향 비율(SER) 조건에서 음향 에코 억제와 근거리 신호 보존 간 균형을 얼마나 효과적으로 조절하는가?
  • RQ5위상 민감성 마스크는 전통적인 진폭 마스크 기반 접근 방식에 비해 청취 품질과 이해도 측면에서 얼마나 뛰어난가?

주요 결과

  • 단일 원거리 음성 발화 조건에서 제안된 RAES 방법은 AEC3(29.976 dB)와 DNN 기반 방법(31.492 dB)을 크게 능가해 40 dB 이상의 ERLE를 달성한다. 특히 음성과 음악이 동시에 에코에 포함된 경우에도 동일한 성능 유지를 보인다.
  • 더블톡 조건에서 α=0.5를 사용한 RAES 모델은 음성 전용 시나리오에서 PESQ 점수 2.816, 음성+음악 조합에서 2.864를 기록하며, AEC3(1.610 및 1.734)와 DNN(2.666 및 2.729)를 모두 초월한다.
  • RAES 모델(α=0.5)의 STOI 점수는 0 dB SER 조건에서 음성 전용 시나리오에서 0.875, 음성+음악 조합에서 0.872를 기록하며, AEC3(0.623 및 0.641)와 DNN(0.856 및 0.848)보다 유의미하게 높다.
  • 2.5 GHz x86_64 CPU에서 모델의 실시간 요율은 단지 0.05로, 개인 기기에서의 실시간 구현에 매우 적합하며, DNN 모델의 0.89 대비 뚜렷한 성능 향상을 보인다.
  • 더블톡 감지기는 훈련 데이터에서 F1 점수 93.0%, 검증 데이터에서 90.3%를 기록하여, 더블톡 기간 동안 정확한 마스크 예측을 지원하는 신뢰할 수 있는 감지 성능을 확보한다.
  • 억제 비율 α는 조정 가능한 트레이드오프를 제공한다: α=0.5는 더 강한 음향 에코 억제를 제공하지만 약간의 왜곡 증가를 수반하며, α=1.0은 더 나은 음성 품질을 제공하지만 약간의 억제 성능 감소를 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.