Skip to main content
QUICK REVIEW

[논문 리뷰] Complex Spectral Mapping With Attention Based Convolution Recurrent Neural Network for Speech Enhancement

Liming Zhou, Yongyu Gao|arXiv (Cornell University)|2021. 04. 12.
Speech and Audio Processing참고 문헌 38인용 수 12
한 줄 요약

이 논문은 복소 스펙트럼 매핑을 위한 복소수 기반의 컨volution 및 순환층을 갖춘 U-Net 유사 인코더-디코더 아키텍처에 주목점 기반 스킵 커넥션을 통합한 새로운 음성 향상 모델인 CARN을 제안한다. CRN에서 직접 스킵 커넥션을 주목점 메커니즘으로 대체함으로써, CARN은 DNS Challenge 2020에서 이전 SOTA 모델보다 PESQ, CSIG 및 DNSMOS와 같은 핵심 지표에서 실기록에서 10% 이상 향상된 최고 성능을 달성한다.

ABSTRACT

Speech enhancement has benefited from the success of deep learning in terms of intelligibility and perceptual quality. Conventional time-frequency (TF) domain methods focus on predicting TF-masks or speech spectrum,via a naive convolution neural network or recurrent neural network.Some recent studies were based on Complex spectral Mapping convolution recurrent neural network (CRN) . These models skiped directly from encoder layers' output and decoder layers' input ,which maybe thoughtless. We proposed an attention mechanism based skip connection between encoder and decoder layers,namely Complex Spectral Mapping With Attention Based Convolution Recurrent Neural Network (CARN).Compared with CRN model,the proposed CARN model improved more than 10% relatively at several metrics such as PESQ,CBAK,COVL,CSIG and son,and outperformed the place 1st model in both real time and non-real time track of the DNS Challenge 2020 at these metrics.

연구 동기 및 목표

  • CRN의 단순한 스킵 커넥션을 주목점 기반 메커니즘으로 대체하여 음성 향상 성능을 향상시키는 것.
  • 위상과 시간적 의존성을 忽시하는 전통적인 TF 도메인 방법의 한계를 해결하는 것.
  • 복소 스펙트럼 매핑과 주목점 기반 메커니즘을 활용하여 비정상적인 잡음 환경에서도 강건성을 향상시키는 것.
  • 합성 및 실제 세계의 노이즈가 섞인 음성 데이터셋 모두에서 뛰어난 성능을 달성하는 것.
  • 주목점 기반 메커니즘이 인코더와 디코더의 특징을 연결하는 데 효과적인지 검증하는 것.

제안 방법

  • PReLU 활성화 함수와 배치 정규화를 사용한 6개의 인코더 및 디코더 Conv2d 블록을 갖춘 U-Net 스타일 아키텍처를 적용한다.
  • 장기적인 시간적 의존성을 모델링하기 위해 인코더와 디코더 사이에 은닉 유닛 수가 512인 LSTM 레이어를 사용한다.
  • 직접 스킵 커넥션 대신 주목점 기반 스킵 커넥션을 도입하여 인코더에서 디코더로 특징을 선택적으로 집계한다.
  • 모델은 시간-주파수 도메인에서 복소수 비율 마스크(CRM)를 예측하며, 이를 입력 STFT와 곱하여 청소된 음성을 재구성한다.
  • 게이트 컨볼루션 변형인 GCARN도 제안되어 이 아키텍처에서 게이트 메커니즘이 필요한지 평가한다.
  • 모델은 CRM 타겟을 사용한 지도 학습으로 훈련되며, PESQ, CSIG, CBAK, COVL, STOI 및 DNSMOS를 사용해 평가된다.

실험 결과

연구 질문

  • RQ1CRN에서 직접 스킵 커넥션 대신 주목점 기반 스킵 커넥션을 사용할 경우 음성 향상 성능이 향상되는가?
  • RQ2U-Net 기반 CRN 아키텍처에 주목점 기반 메커니즘을 통합하면 합성 및 실제 세계의 노이즈가 섞인 음성에서 더 좋은 성능을 낼 수 있는가?
  • RQ3DNS Challenge 2020 데이터셋에서 CARN은 DCCRN-E 및 poCoNet과 같은 최고 성능 모델보다 어떻게 비교되는가?
  • RQ4주목점 메커니즘이 스킵 커넥션 동안 노이즈가 섞인 특징을 얼마나 효과적으로 걸러내는가?
  • RQ5이 아키텍처에서 주목점 기반 메커니즘과 함께 게이트 컨볼루션을 사용할 경우 추가적인 성능 향상이 이루어지는가?

주요 결과

  • Dataset 1에서 CARN은 기준 모델인 CRN 대비 PESQ에서 12.2% 상대적 향상, CBAK에서 10.7%, COVL에서 11.7%, CSIG에서 10.8% 향상되었다.
  • GCARN은 GCRN 대비 PESQ에서 19.1% 상대적 향상, CSIG에서 15.1% 향상되었으며, 이는 주목점 기반 메커니즘이 적용된 경우 게이트 컨볼루션의 필요성이 낮을 수 있음을 시사한다.
  • DNS Challenge 2020 비실시간 트랙에서 CARN은 이전 SOTA 모델인 poCoNet를 PESQ에서 6.2% 향상, CBAK에서 20.7%, COVL에서 5.3%, CSIG에서 3.7% 향상시켰다.
  • DNS Challenge 2020 블라인드 테스트 세트에서 CARN은 비리버버버션, 리버버버션, 실기록 모두에서 최고의 DNSMOS 점수 3.72를 기록했다.
  • GCARN은 DNSMOS 성능에서 CARN과 동일한 평균 3.72를 기록하여 주목점 기반 메커니즘이 강건함을 확인했다.
  • 주목점 기반 메커니즘이 스킵 커넥션 동안 노이즈가 섞인 특징을 효과적으로 걸러내어 CRN의 단순한 스킵 커넥션 대비 뚜렷한 성능 향상을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.