Skip to main content
QUICK REVIEW

[논문 리뷰] A fully recurrent feature extraction for single channel speech enhancement

P. V. Muhammed Shifas, Claudio Santelli|arXiv (Cornell University)|2020. 06. 09.
Speech and Audio Processing참고 문헌 24인용 수 5
한 줄 요약

이 논문은 소음 환경에서의 강건성을 향상시키기 위해 음성 강화 모델에 완전히 순환적인 특징 추출 모듈인 gruCNN을 통합한다. 게이트드 리커런트 유닛(GRUs)을 합성곱 레이어 내부에 통합함으로써 모델은 시간에 따라 변화하는 국소적 소음 통계를 포착할 수 있으며, 기존의 순수한 CNN보다 최대 1.5 dB의 세그먼트별 SNR 향상과 0.4 MOS 향상을 달성하면서도 파rameter 수를 25% 감소시킨다.

ABSTRACT

Convolutional neural network (CNN) modules are widely being used to build high-end speech enhancement neural models. However, the feature extraction power of vanilla CNN modules has been limited by the dimensionality constraint of the convolution kernels that are integrated - thereby, they have limitations to adequately model the noise context information at the feature extraction stage. To this end, adding recurrency factor into the feature extracting CNN layers, we introduce a robust context-aware feature extraction strategy for single-channel speech enhancement. As shown, adding recurrency results in capturing the local statistics of noise attributes at the extracted features level and thus, the suggested model is effective in differentiating speech cues even at very noisy conditions. When evaluated against enhancement models using vanilla CNN modules, in unseen noise conditions, the suggested model with recurrency in the feature extraction layers has produced a segmental SNR (SSNR) gain of up to 1.5 dB, an improvement of 0.4 in subjective quality in the Mean Opinion Score scale, while the parameters to be optimized are reduced by 25%.

연구 동기 및 목표

  • 기본적인 CNN 모델이 특징 추출 과정에서 장기적 소음 맥락을 모델링하는 데 한계를 가진다는 문제를 해결하기 위해.
  • 예측할 수 없는 비정적 소음 조건 하에서도 음성 강화 성능을 향상시키기 위해.
  • 성능을 희생시키지 않은 채 모델 복잡도를 감소시켜 자원이 제한된 장치에의 배포를 가능하게 하기 위해.
  • 시간적 순환을 특징 추출 단계에 직접 통합함으로써 별도의 후처리 모듈로 사용하지 않기 위해.
  • 강건한 음성 강화를 위해 바이너리별 순환 모델링의 효과를 검증하기 위해.

제안 방법

  • 시간적 모델링을 특징 추출 수준에서 가능하게 하기 위해 게이트드 리커런트 유닛(GRUs)을 합성곱 레이어 내부에 통합한 새로운 gruCNN 셀을 제안한다.
  • 각 합성곱 커널에 순환 연결을 추가하여 시간에 따라 변화하는 소음 통계를 포착할 수 있도록 수정된 CNN 아키텍처를 사용한다.
  • gruCNN을 특징 추출에, 완전히 연결된 레이어를 스펙트럼 매핑에 사용하는 하이브리드 모델인 gruCNN_FC-SE를 활용한다.
  • 스펙트로그램 기반 입력 표현 방식을 채택하여 각 주파수 대역을 시간 시리즈로 간주함으로써 자기회귀적 음성 특성을 활용한다.
  • GRU가 표준 LSTMs보다 더 적은 파rameter로 장기적 의존성을 학습할 수 있음을 활용한다.
  • 다양한 소음 유형이 포함된 다중 화자 데이터셋에서 엔드 투 엔드로 모델을 훈련시켰으며, 예측할 수 없는 조건도 포함한다.

실험 결과

연구 질문

  • RQ1특징 추출 레이어에 직접 순환성을 통합함으로써 단일 채널 음성 강화에서 예측할 수 없는 소음 유형에 대한 강건성을 향상시킬 수 있는가?
  • RQ2기본적인 특징 추출 후 RNN 처리 방식과 비교했을 때 바이너리별 순환 모델링은 성능과 파rameter 효율성 측면에서 어떻게 다른가?
  • RQ3제안된 gruCNN 기반 특징 추출기가 저 SNR 조건에서 음성의 이해 가능성과 청취자적 품질을 얼마나 향상시키는가?
  • RQ4기존의 RNN-CNN 하이브리드 모델 대비 파rameter 수를 줄였을 때도 우수한 성능을 달성할 수 있는가?
  • RQ5순환 구조는 비정적 소음을 음성 성분에서 더 잘 분리하는 데 기여하는가?

주요 결과

  • gruCNN_FC-SE 모델은 예측할 수 없는 소음 조건에서 기존의 순수한 CNN 기반 모델 대비 최대 1.5 dB의 세그먼트별 SNR(SSNR) 향상을 달성했다.
  • 주관적 평균 의견 점수(MOS)가 0.4점 향상되어 3.16에 도달했으며, 이는 심미적 품질 향상의 중요한 증거이다.
  • CNN_LSTM-SE 기준 대비 파ram터 수를 25% 감소시켰으며, 27.22M 파rameter 대비 36.10M로 줄였다.
  • 모든 소음 유형에서 일관된 성능 향상이 관찰되었으며, 특히 비정적 도시 소음과 정적 건설 소음과 같은 어려운 조건에서도 성능이 유의미했다.
  • 모든 SNR 수준에서 객관적 평가 지표(PESQ, STOI, COVL, SSNR)에서 CNN_FC-SE 및 CNN_LSTM-SE를 모두 초월하는 성능을 보였다.
  • 지역적이고 저주파 소음(예: 도시 소음)에서 음성과의 구분 능력이 뛰어나, 바이너리별 순환 모델링을 통한 국소적 통계 모델링 덕분으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.