Skip to main content
QUICK REVIEW

[논문 리뷰] Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses

Shengkui Zhao, Trung Hieu Nguyen|arXiv (Cornell University)|2021. 02. 03.
Speech and Audio Processing참고 문헌 22인용 수 4
한 줄 요약

이 논문은 복소수 기반 U-Net 및 CRN 모델을 사용한 단방향 음성 향상에서 성능을 향상시키기 위해 복소수 합성곱 블록 주의 메커니즘(CCBAM)과 시간-주파수 병합 손실 함수를 제안한다. CCBAM은 복소수 합성곱의 채널 및 공간적 특징에 주의를 기울여 특징 표현을 향상시키며, 혼합 손실 함수는 시간 및 주파수 도메인에서 동시에 최적화하여 두 데이터셋에서 PESQ, STOI, SI-SNR 지표에 있어 뚜렷한 향상을 이끌어내며 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Deep complex U-Net structure and convolutional recurrent network (CRN) structure achieve state-of-the-art performance for monaural speech enhancement. Both deep complex U-Net and CRN are encoder and decoder structures with skip connections, which heavily rely on the representation power of the complex-valued convolutional layers. In this paper, we propose a complex convolutional block attention module (CCBAM) to boost the representation power of the complex-valued convolutional layers by constructing more informative features. The CCBAM is a lightweight and general module which can be easily integrated into any complex-valued convolutional layers. We integrate CCBAM with the deep complex U-Net and CRN to enhance their performance for speech enhancement. We further propose a mixed loss function to jointly optimize the complex models in both time-frequency (TF) domain and time domain. By integrating CCBAM and the mixed loss, we form a new end-to-end (E2E) complex speech enhancement framework. Ablation experiments and objective evaluations show the superior performance of the proposed approaches (https://github.com/modelscope/ClearerVoice-Studio).

연구 동기 및 목표

  • 복소수 기반 합성곱 레이어의 표현 능력을 향상시켜 단방향 음성 향상 성능을 향상시키는 것.
  • 기존 복소수 기반 딥 러닝 모델의 음성 향상에 적합한 주의 메커니즘의 한계를 해결하는 것.
  • 모든 복소수 기반 합성곱 레이어와 호환 가능한 경량이며 일반적인 주의 모듈을 개발하는 것.
  • 혼합 손실 함수를 통해 시간 및 주파수 도메인에서 동시에 음성 향상을 최적화하는 것.
  • 엔드 투 엔드 복소수 네트워크를 사용해 단방향 음성 향상 벤치마크에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • 복소수 특징 맵의 채널 및 공간 차원에 별도로 압축-흥장(.squeeze-and-excite) 연산을 적용하는 복소수 합성곱 블록 주의 메커니즘(CCBAM)을 제안한다.
  • CCBAM은 복소수 특징의 실수부 및 허수부 양쪽에 대해 전역 평균 풀링과 학습 가능한 완전 연결 레이어를 사용해 주의 가중치를 계산한다.
  • 딥 커플렉스 U-Net 및 CRN 모델의 디코더 레이어와 스킵 커넥션에 CCBAM을 통합하여 특징 표현을 정교화한다.
  • 이deal complex ratio mask(CRM)의 실수부 및 허수부에 대해 SI-SNR(스케일 불변 소스 대 노이즈 비율)와 MSE(평균 제곱 오차)를 병합한 혼합 손실 함수를 설계한다.
  • 엔드 투 엔드로 모델을 최적화하여 시간 및 주파수 도메인에서 CRM 추정 성능을 향상시킨다.
  • DCUnet에는 64ms 헨윈 창과 16ms 힙을, DCCRN에는 20ms/10ms를 사용하여 STFT를 적용하고, PyTorch와 Adam 옵티마이저를 사용한다.

실험 결과

연구 질문

  • RQ1복소수 기반 주의 메커니즘이 단방향 음성 향상 모델의 합성곱 레이어 표현 능력을 향상시킬 수 있는가?
  • RQ2CCBAM을 딥 커플렉스 U-Net 및 CRN 아키텍처에 통합하면 성능 향상이 이루어지는가?
  • RQ3SI-SNR와 CRM-MSE를 병합한 시간-주파수 병합 손실 함수는 단일 도메인 최적화를 넘어서 음성 향상 성능을 향상시킬 수 있는가?
  • RQ4제안된 프레임워크는 다양한 노이즈 및 정상 음성 데이터셋에서 최신 기술 수준의 모델과 비교해 어떻게 성능을 내는가?
  • RQ5CCBAM 모듈은 다양한 모델 아키텍처와 데이터 분포에서 일관된 성능 향상을 제공하는가?

주요 결과

  • CCBAM과 혼합 손실을 모두 통합한 DCUnet-MC 및 DCCRN-MC 모델은 각각 데이터셋-1과 데이터셋-2에서 최고의 PESQ 점수 3.44와 3.30을 기록했다.
  • 데이터셋-1에서 DCUnet-MC 모델은 원본 DCUnet 대비 PESQ를 0.19 향상시키고 SI-SNR를 1.62 dB 향상시켰으며, DCUnet-M 대비로도 각각 0.10과 0.91 dB 향상되었다.
  • 데이터셋-2에서 DCCRN-MC 모델은 PESQ 3.30을 기록했고, DCCRN-M 대비 0.06 향상되었으며, 기준 DCCRN 대비 0.10 향상되었다.
  • 혼합 손실 함수는 SI-SNR를 데이터셋-1에서 0.44 dB, 데이터셋-2에서 0.44 dB 향상시켰다.
  • CCBAM 모듈은 성능 향상에 기여했으며, 데이터셋-1에서 DCUnet-MC는 DCUnet-M 대비 PESQ 0.06 향상 및 SI-SNR 0.74 dB 향상되었다.
  • 제안된 프레임워크는 소규모 WSJ0+DEMAND 및 대규모 DNS 챌린지 데이터셋에서 최신 기술 수준의 성능을 달성하여 강건성과 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.