Skip to main content
QUICK REVIEW

[논문 리뷰] DCCRN+: Channel-wise Subband DCCRN with SNR Estimation for Speech Enhancement

Shubo Lv, Yanxin Hu|arXiv (Cornell University)|2021. 06. 16.
Speech and Audio Processing참고 문헌 34인용 수 7
한 줄 요약

DCCRN+는 학습 가능한 필터, 복소수 TF-LSTM, 컨볼루션 스케일 연결, 사전 SNR 추정, 후처리를 통합한 서브밴드 처리 프레임워크를 도입하여 음질 향상과 노이즈 억제를 동시에 달성한다. Interspeech 2021 DNS 챌린지에서 3.51 MOS를 기록하며 DCCRN 및 기타 최고 수준의 모델들을 능가하는 PESQ 및 DNSMOS 성능을 확보하였다.

ABSTRACT

Deep complex convolution recurrent network (DCCRN), which extends CRN with complex structure, has achieved superior performance in MOS evaluation in Interspeech 2020 deep noise suppression challenge (DNS2020). This paper further extends DCCRN with the following significant revisions. We first extend the model to sub-band processing where the bands are split and merged by learnable neural network filters instead of engineered FIR filters, leading to a faster noise suppressor trained in an end-to-end manner. Then the LSTM is further substituted with a complex TF-LSTM to better model temporal dependencies along both time and frequency axes. Moreover, instead of simply concatenating the output of each encoder layer to the input of the corresponding decoder layer, we use convolution blocks to first aggregate essential information from the encoder output before feeding it to the decoder layers. We specifically formulate the decoder with an extra a priori SNR estimation module to maintain good speech quality while removing noise. Finally a post-processing module is adopted to further suppress the unnatural residual noise. The new model, named DCCRN+, has surpassed the original DCCRN as well as several competitive models in terms of PESQ and DNSMOS, and has achieved superior performance in the new Interspeech 2021 DNS challenge

연구 동기 및 목표

  • 소음 환경에서 음질을 향상시키면서도 저비용 계산과 실시간 성능를 유지하기 위해.
  • 딥 러닝 기반 음성 증강에서 노이즈 억제와 음성 왜곡 간의 상충 관계를 해결하기 위해.
  • DCCRN 프레임워크 내의 아키텍처 혁신을 통해 시간적 모델링 및 특징 표현을 향상시키기 위해.
  • 실시간 적용에 적합한 종단 간 훈련이 가능하고, 컴act하며 효율적인 음성 증강 시스템을 개발하기 위해.

제안 방법

  • 고정된 FIR 필터를 서브밴드 분해 및 재구성에 사용하는 대신 학습 가능한 신경망 필터로 대체하여 종단 간 훈련이 가능하고 추론 속도가 향상된다.
  • 시간과 주파수 축을 모두 고려한 복소수 값 순환 유닛을 사용하는 복소수 TF-LSTM 블록을 도입하여 시간적 의존성을 모델링한다.
  • 에코더와 디코더 간 직접적인 스케일 연결을 대체하여, 스케일 연결 이전에 특징 표현을 집약하고 정제하는 컨볼루션 경로를 도입한다.
  • 디코더 내부에 보조적인 사전 SNR 추정 모듈을 통합하여 다중 작업 학습 목표로 설정함으로써 음질 유지에 기여한다.
  • 잔여 노이즈 억제 및 청취 품질 향상을 위해 MMSE-LSA 기반 후처리 모듈을 적용한다.
  • 복소수 스펙트로그램을 최적화하기 위해 복소수 합성 및 역합성 레이어를 사용하는 대칭형 에코더-디코더 아키텍처를 활용한다.

실험 결과

연구 질문

  • RQ1학습 가능한 서브밴드 필터는 음질 저하 없이 추론 속도 향상과 모델의 컴act함을 향상시킬 수 있는가?
  • RQ2표준 LSTM을 복소수 TF-LSTM으로 대체하면 시간적 모델링 향상과 증강 성능 향상에 기여하는가?
  • RQ3에코더와 디코더 레이어 사이의 컨볼루션 경로는 특징 표현 향상과 노이즈 억제에 기여하는가?
  • RQ4보조 작업으로 사전 SNR 추정을 통합하면 청취 품질 향상에 기여하는가?
  • RQ5후처리를 통해 잔여 노이즈를 추가로 감소시키고 주관적 청취 품질을 향상시킬 수 있는가?

주요 결과

  • Voice Bank + DEMAND 데이터셋에서 DCCRN+는 PESQ 3.32를 기록하여 원본 DCCRN 대비 0.04 향상되었다.
  • 학습 가능한 서브밴드 필터를 적용한 모델은 실시간 요소(RTF)가 0.137로 FIR 필터 기반 서브밴드 버전보다 뚜렷이 빠르게 작동한다.
  • 복소수 TF-LSTM 도입으로 학습 가능한 필터를 갖춘 서브밴드 DCCRN 대비 PESQ가 0.05 향상되었다.
  • SNR 추정 모듈은 PESQ를 0.03 향상시켜 음질 유지에 기여하는 것으로 확인되었다.
  • DNS-2021 블라인드 테스트 세트에서 DCCRN+는 DNSMOS 점수 3.46을 기록하여 전체 20개 제출 중 최고 기록을 달성했다.
  • 주관적 P.835 MOS 평가에서 DCCRN+는 총 MOS 3.51을 기록하여 넓은 대역 트랙에서 상위 4개 이내로 랭크되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.