Skip to main content
QUICK REVIEW

[논문 리뷰] Dense CNN with Self-Attention for Time-Domain Speech Enhancement

Ashutosh Pandey, DeLiang Wang|arXiv (Cornell University)|2020. 09. 03.
Speech and Audio Processing참고 문헌 47인용 수 7
한 줄 요약

이 논문은 시계열 음성 강화를 위한 밀도 높은 컨volution 네트워크를 제안하며, 밀도 블록을 통한 특징 재사용과 자기주의(self-attention)를 통한 맥락 집약을 조합하여 음성의 진폭과 위상을 동시에 향상시킨다. 이 방법은 새로운 위상 제약 진폭 손실(PCM)을 사용하여 최신 기술 수준(SOTA) 성능을 달성하였으며, 다양한 노이즈 조건에서 인과적 및 비인과적 환경 모두에서 이전 방법들을 크게 능가한다.

ABSTRACT

Speech enhancement in the time domain is becoming increasingly popular in recent years, due to its capability to jointly enhance both the magnitude and the phase of speech. In this work, we propose a dense convolutional network (DCN) with self-attention for speech enhancement in the time domain. DCN is an encoder and decoder based architecture with skip connections. Each layer in the encoder and the decoder comprises a dense block and an attention module. Dense blocks and attention modules help in feature extraction using a combination of feature reuse, increased network depth, and maximum context aggregation. Furthermore, we reveal previously unknown problems with a loss based on the spectral magnitude of enhanced speech. To alleviate these problems, we propose a novel loss based on magnitudes of enhanced speech and a predicted noise. Even though the proposed loss is based on magnitudes only, a constraint imposed by noise prediction ensures that the loss enhances both magnitude and phase. Experimental results demonstrate that DCN trained with the proposed loss substantially outperforms other state-of-the-art approaches to causal and non-causal speech enhancement.

연구 동기 및 목표

  • 시계열 음성 강화에서 음성의 진폭과 위상을 동시에 향상시키는 문제를 해결하기 위해.
  • 진폭만을 고려한 손실 함수의 한계를 극복하여 신호 대 노이즈 비율(SNR) 향상의 일관성 결여와 잡음 유도 잡음의 발생을 방지하기 위해.
  • 밀도 블록과 자기주의를 활용해 시계열 음성 강화의 특징 추출 및 맥락 모델링을 향상시키기 위해.
  • 실시간 처리가 가능하고 비인과적인 아키텍처를 개발하여 다양한 노이즈 유형과 SNR 수준에서 잘 일반화되도록 하기 위해.
  • 학습된 코퍼스 외부로의 DNN 기반 음성 강화의 일반화 능력을 조사하기 위해.

제안 방법

  • 제안된 아키텍처는 스킵 연결을 포함한 인코더-디코더 프레임워크를 사용하며, 각 인코더 및 디코더 레이어에는 밀도 블록과 자기주의 모듈이 포함되어 있다.
  • 밀도 블록은 레이어 간 특징 맵을 연결함으로써 특징 재사용과 더 깊은 네트워크 학습을 가능하게 한다.
  • 자기주의 메커니즘은 입력 시퀀스에서 관련 프레임에 주목함으로써 선택적 맥락 집약을 가능하게 하여 반복되는 자음과 음성의 조화 구조를 더 잘 모델링한다.
  • 새로운 손실 함수인 PCM(위상 제약 진폭 손실)은 향상된 음성의 진폭과 예측된 노이즈의 진폭을 조합하여 위상 추정을 암묵적으로 제약한다.
  • 손실 함수는 SNR 일관성 향상과 잡음 감소를 위해 설계되었으며, 同시에 높은 목적적 품질 점수 유지를 유지한다.
  • 모델은 WSJ 코퍼스에서 학습되고, 학습되지 않은 WSJ 화자들에 대해 평가되어 교차 코퍼스 일반화 능력이 평가된다.

실험 결과

연구 질문

  • RQ1밀도 높은 CNN에 자기주의를 결합한 아키텍처가 시계열 음성 강화에서 진폭과 위상을 효과적으로 향상시킬 수 있는가?
  • RQ2노이즈 예측을 포함한 진폭 기반 손실이 기존 스펙트럼 진폭 손실에 비해 더 나은 위상 추정과 잡음 감소를 이끌 수 있는가?
  • RQ3제안된 네트워크의 자기주의 메커니즘이 관련 음성 세그먼트에 어떻게 집중하는가? 그리고 인과적과 비인과적 추론 간에 차이가 있는가?
  • RQ4제안된 모델이 학습 데이터 외의 화자와 노이즈 유형으로 일반화 가능한가?
  • RQ5시계열 음성 강화에서 수신 필드 크기와 확장(dilation)이 성능에 미치는 영향은 무엇인가?

주요 결과

  • PCM 손실을 사용한 제안된 DCN은 인과적 및 비인과적 설정에서 모든 베이스라인 모델을 능가하며, NC-GCRN에 비해 STOI 평균 1.3% 향상 및 PESQ 0.21 향상되었으며, p < 0.0001로 통계적으로 유의미하다.
  • 실시간 버전인 DCN-PCM는 최고의 실시간 베이스라인인 TCNN에 비해 STOI 1.5% 향상 및 PESQ 0.19 향상되었다.
  • 주의 맵 분석 결과, 비인과적 DCN은 발성 구간(프레임 125–185)과 고주파 성분에 집중하는 반면, 인과적 DCN은 인과성 제약로 인해 이전 프레임에 더 집중한다.
  • 인과적 DCN의 자기주의 메커니즘은 비인과적 DCN보다 더 날카롭게 작동하여 시간적 제약 하에서 더 집중적인 맥락 선택을 보였다.
  • PCM 손실은 SNR 향상의 일관성 결여 문제를 해결하고, 진폭 전용 손실 학습에서 발생하는 알려지지 않은 잡음 유형의 잡음을 감소시켰으며, 동시에 높은 목적적 품질 점수를 유지하였다.
  • 확장(dilation) 없이도 작은 수신 필드와 자기주의를 갖춘 제안된 DCN은 확장 컨volution을 사용한 모델보다 우수한 성능을 보였으며, 아키텍처 설계의 효과성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.