Skip to main content
QUICK REVIEW

[논문 리뷰] Interactive Speech and Noise Modeling for Speech Enhancement

Chengyu Zheng, Xiulian Peng|arXiv (Cornell University)|2020. 12. 17.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 음성과 잡음을 동시에 모델링하고 양 분지 간 상호작용 모듈을 통해 음질 향상과 잔여 잡음 억제를 달성하는 이중 분지 컨볼루션 신경망인 SN-Net을 제안한다. 잔여-컨볼루션-애트텐션(RA) 블록을 통합하고 음성 및 잡음 분지 간 특징 교환을 가능하게 함으로써, Voice Bank + DEMAND 및 DNS Challenge와 같은 공개 벤치마크에서 음성 증강 및 화자 분리 작업 모두에서 최신 기술(SOTA)을 초월하는 성능을 달성한다.

ABSTRACT

Speech enhancement is challenging because of the diversity of background noise types. Most of the existing methods are focused on modelling the speech rather than the noise. In this paper, we propose a novel idea to model speech and noise simultaneously in a two-branch convolutional neural network, namely SN-Net. In SN-Net, the two branches predict speech and noise, respectively. Instead of information fusion only at the final output layer, interaction modules are introduced at several intermediate feature domains between the two branches to benefit each other. Such an interaction can leverage features learned from one branch to counteract the undesired part and restore the missing component of the other and thus enhance their discrimination capabilities. We also design a feature extraction module, namely residual-convolution-and-attention (RA), to capture the correlations along temporal and frequency dimensions for both the speech and the noises. Evaluations on public datasets show that the interaction module plays a key role in simultaneous modeling and the SN-Net outperforms the state-of-the-art by a large margin on various evaluation metrics. The proposed SN-Net also shows superior performance for speaker separation.

연구 동기 및 목표

  • 기존 음성 증강 방법이 음성 모델링에만 집중하고 잡음 특성은 忽시하는 한계를 해결하기 위해.
  • 양방향 정보 흐름을 갖춘 분지 간 상호작용을 통해 음성과 잡음을 동시에 모델링하여 음성 증강 성능을 향상시키기 위해.
  • 상호작용 모듈을 통해 음성 및 잡음 분지의 보완적 특징을 활용하여 잔여 잡음과 음성 왜곡을 감소시키기 위해.
  • 음성과 잡음 양쪽에서 전역적인 시간적 및 주파수 의존성을 포착할 수 있는 강력한 특징 추출 메커니즘을 개발하기 위해.
  • 제안된 프레임워크를 화자 분리 작업으로 확장하여 단일 화자 증강을 넘어선 일반화 능력을 입증하기 위해.

제안 방법

  • SN-Net는 음성 및 잡음 분지에 동일한 구조를 공유하는 이중 분지 인코더-디코더 아키텍처를 사용하여 양 신호의 공동 모델링을 가능하게 한다.
  • 중간 계층의 다수에 상호작용 모듈을 삽입하여 음성 및 잡음 분지 간 특징 교환을 허용함으로써 식별성 향상과 특징 정제를 강화한다.
  • 잔여-컨볼루션-애트텐션(RA) 블록은 잔여 연결, 디프스와이즈 분리형 컨볼루션, 그리고 병렬적인 시간적 및 주파수 방향 자기애트텐션을 조합하여 장거리 의존성을 모델링한다.
  • 시간 자기애트텐션은 시간 프레임 간 전역 패턴을 캡처하고, 주파수 방향 자기애트텐션은 주파수 빈도 간 스펙트럼 상관관계를 모델링한다.
  • 재구성 손실과 청각적 지표의 조합을 사용하여 네트워크를 훈련시키며, 화자 분리 작업에는 순열 불변 훈련(Permutation-Invariant Training)을 적용한다.
  • 양 분지의 특징 맵은 RA 블록을 거쳐서 점진적으로 표현을 정제하고 최종 출력 생성 전에 처리된다.

실험 결과

연구 질문

  • RQ1음성과 잡음을 동시에 모델링하고 분지 간 상호작용을 통해 성능 향상을 이룰 수 있는가? 이는 단방향 음성 전용 모델링 대비 음성 증강 성능 향상에 기여하는가?
  • RQ2시간 및 주파수 차원에서 자기애트텐션 메커니즘을 통합할 경우, 잡음이 있는 음성에서의 특징 표현에 어떤 영향을 미치는가?
  • RQ3음성 및 잡음 분지 간의 상호작용이 잔여 잡음과 음성 왜곡을 어느 정도 감소시키는가?
  • RQ4제안된 이중 분지 프레임워크는 화자 분리 작업으로 효과적으로 확장될 수 있는가? 그리고 기존 최신 기술(SOTA) 방법들과 비교해 볼 때 어떤가?
  • RQ5RA 블록과 상호작용 모듈은 다양한 잡음 유형에서의 전체 증강 품질과 강인성 향상에 어떤 기여를 하는가?

주요 결과

  • Voice Bank + DEMAND에서 SN-Net는 PESQ 점수 3.12를 기록하여, GAN 기반 및 자기애트텐션 모델을 포함한 모든 비교 SOTA 방법을 압도적으로 뛰어넘었다.
  • DNS Challenge 데이터셋에서 SN-Net는 SDRi 8.39 dB, PESQ 2.50을 달성하여, Conv-TasNet(SDRi: 7.57 dB, PESQ: 2.14)보다 각각 0.82 dB 및 0.36점 향상시켰다.
  • 상호작용 모듈은 성능 향상에 기여하며, 추론 실험을 통해 잔여 잡음 감소와 음성 명료도 향상에 핵심적인 역할을 한다는 것이 확인되었다.
  • RA 블록은 주어진 주의 맵을 통해 음성에서는 전역적 집중, 잡음에서는 국소적 패턴을 보여주며 장거리 시간적 및 주파수 의존성을 효과적으로 포착한다.
  • 화자 분리 작업에서는 SN-Net가 Conv-TasNet 대비 SDRi 0.82 dB, PESQ 0.36점 향상시켜 다중 소스 분리 작업에 대한 강력한 일반화 능력을 입증했다.
  • 모든 지표에서 두 데이터셋 모두 최고 점수를 기록하여, 다양한 잡음 조건 하에서도 뛰어난 강인성과 증강 품질을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.