Skip to main content
QUICK REVIEW

[논문 리뷰] S-DCCRN: Super Wide Band DCCRN with learnable complex feature for speech enhancement

Shubo Lv, Yihui Fu|arXiv (Cornell University)|2021. 11. 16.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 32 kHz 신호를 위한 초광대역 음성 향상 모델인 S-DCCRN을 제안한다. 이 모델은 학습 가능한 복소 특징 인코딩과 학습 가능한 스펙트럼 압축을 결합한 서브밴드 및 패널 밴드 처리를 통합한다. 계단식 서브밴드 및 패널 밴드 DCCRN 아키텍처, 엔드 투 엔드 복소 특징 인코딩/디코딩, 그리고 학습 가능한 스펙트럼 압축을 통한 적응형 에너지 조정을 통해 S-DCCRN은 DNS-2021 블라인드 테스트 세트에서 3.62의 MOS 점수를 기록하며, PercepNet 및 기타 선도적 모델들을 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In speech enhancement, complex neural network has shown promising performance due to their effectiveness in processing complex-valued spectrum. Most of the recent speech enhancement approaches mainly focus on wide-band signal with a sampling rate of 16K Hz. However, research on super wide band (e.g., 32K Hz) or even full-band (48K) denoising is still lacked due to the difficulty of modeling more frequency bands and particularly high frequency components. In this paper, we extend our previous deep complex convolution recurrent neural network (DCCRN) substantially to a super wide band version -- S-DCCRN, to perform speech denoising on speech of 32K Hz sampling rate. We first employ a cascaded sub-band and full-band processing module, which consists of two small-footprint DCCRNs -- one operates on sub-band signal and one operates on full-band signal, aiming at benefiting from both local and global frequency information. Moreover, instead of simply adopting the STFT feature as input, we use a complex feature encoder trained in an end-to-end manner to refine the information of different frequency bands. We also use a complex feature decoder to revert the feature to time-frequency domain. Finally, a learnable spectrum compression method is adopted to adjust the energy of different frequency bands, which is beneficial for neural network learning. The proposed model, S-DCCRN, has surpassed PercepNet as well as several competitive models and achieves state-of-the-art performance in terms of speech quality and intelligibility. Ablation studies also demonstrate the effectiveness of different contributions.

연구 동기 및 목표

  • 초광대역(32 kHz) 음성 향상에 효과적인 딥 러닝 모델의 부족을 해결하기 위해, 고주파 성분을 모델링하고 스펙트럼 차원이 증가하는 문제를 다루는 것.
  • 국소(서브밴드) 및 전반적(패널 밴드) 주파수 정보를 활용하여 고음질 음성 향상에서 음성 품질과 이해도를 향상시키는 것.
  • 고정된 스펙트럼 압축 방법의 한계를 극복하기 위해, 주파수 대역 간 에너지 분포를 동적으로 조정할 수 있는 학습 가능한 스펙트럼 압축 메커니즘을 도입하는 것.
  • 엔드 투 엔드 학습 가능한 복소 특징 인코더 및 디코더를 통해 입력 및 출력 표현을 정교화하여 특징 정밀도와 노이즈 제거 성능을 향상시키는 것.

제안 방법

  • 모델은 계단식 서브밴드 및 패널 밴드(SAF) 처리 모듈을 사용하며, 두 개의 경량 DCCRN 하위 모듈을 활용한다: 하나는 저주파 및 고주파 대역을 별도로 처리하고, 다른 하나는 상하이 끼워넣기 전에 밴드 간 전이를 부드럽게 하는 패널 밴드 통합을 위한 것이다.
  • STFT 이후에 복소 특징 인코더(CFE)를 적용하여 입력 특징을 정교화하고, iSTFT 이전에 시간-주파수 표현을 재구성하기 위해 복소 특징 디코더(CFD)를 사용하며, 양자 모두 엔드 투 엔드로 훈련된다.
  • 학습 가능한 스펙트럼 압축(LSC)은 다양한 주파수 대역의 에너지를 적응적으로 조정하기 위해 도입되었으며, 훈련 중에 압축 비율이 학습되어 고주파 성분의 세부 정보를 유지한다.
  • 서브밴드 DCCRN에서 그룹 복소 컨볼루션을 사용하여 저주파 및 고주파 성분을 별도로 처리함으로써 모델링 효율성과 성능을 향상시킨다.
  • 서브밴드 및 패널 밴드 브랜치의 인코더와 디코더 사이에 스위프 커넥션을 적용하여 특징 무결성을 유지하고 정보 손실을 줄인다.
  • 최종 모델인 S-DCCRN은 SAF 모듈, CFE/CFD, LSC를 통합하여 32 kHz 샘플링 레이트에서 뛰어난 노이즈 제거 및 음성 품질 향상을 실현한다.
Fig. 1 : Network structure of the proposed S -DCCRN
Fig. 1 : Network structure of the proposed S -DCCRN

실험 결과

연구 질문

  • RQ1계단식 서브밴드 및 패널 밴드 처리 아키텍처는 32 kHz 초광대역 신호의 음성 향상 성능을 향상시킬 수 있는가?
  • RQ2표준 STFT 입력에 비해 엔드 투 엔드 학습 가능한 복소 특징 인코딩 및 디코딩은 특징 표현과 음성 품질을 향상시키는가?
  • RQ3학습 가능한 스펙트럼 압축은 고주파 성분의 유지 및 전반적인 노이즈 제거 성능 향상에 얼마나 기여하는가?
  • RQ4S-DCCRN 모델은 PercepNet 및 DCCRN과 같은 최신 기술 수준의 모델들과 비교해 목적적 및 주관적 음성 품질 지표에서 어떻게 성능을 내는가?

주요 결과

  • S-DCCRN은 DNS-2021 블라인드 테스트 세트에서 평균 의견 점수(MOS) 3.62를 기록하여 RNNoise(2.32), DCCRN(3.30), PercepNet(2.73)을 크게 앞서며 뛰어난 성능을 보였다.
  • SAF 모듈만으로도 기준 DCCRN 대비 PESQ 점수를 0.17 향상시켰으며, 더 작은 모델 크기임에도 불구하고 서브밴드 및 패널 밴드 융합의 유용성을 입증했다.
  • 학습 가능한 스펙트럼 압축(LSC)을 추가하면 PESQ 점수에 0.07의 추가 향상이 있었으며, 고정 압축 방식보다 고주파 에너지를 더 효과적으로 유지하는 것을 모델이 학습하는 것으로 나타났다.
  • CFE/CFD 블록만으로는 고주파 에너지가 낮아 성능이 열등했지만, LSC와 조합하면 SAF 모듈만 사용한 경우보다 PESQ 점수 0.08 향상되었다.
  • 학습된 스펙트럼 압축 비율은 고주파 대역(13 kHz 이상)이 약 0.5 수준으로 덜 압축됨을 보여주며, 중요한 청각적 세부 정보를 유지함을 시사한다.
  • VoiceBank 및 DEMAND 데이터셋에서 S-DCCRN은 PESQ 2.84, CSIG 4.03, STOI 0.940을 기록하여 다수의 지표에서 최신 기술 수준의 성능을 입증했다.
Fig. 2 : Complex feature encoder/decoder (CFE/CFD) module
Fig. 2 : Complex feature encoder/decoder (CFE/CFD) module

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.