Skip to main content
QUICK REVIEW

[논문 리뷰] TSTNN: Two-stage Transformer based Neural Network for Speech Enhancement in the Time Domain

Kai Wang, Bengbeng He|arXiv (Cornell University)|2021. 03. 18.
Speech and Audio Processing참고 문헌 27인용 수 11
한 줄 요약

이 논문은 시간 도메인에서 엔드 투 엔드 음성 향상에 적합한 두 단계 기반 트랜스포머 신경망인 TSTNN을 제안한다. 이는 국소적이고 전반적인 특징을 추출하기 위해 스택된 두 단계 트랜스포머 모듈을 사용하고, 표현을 정밀하게 다듬기 위한 마스킹 모듈과 청소된 음성을 복원하기 위한 디코더를 포함한다. 이를 통해 기준 데이터셋에서 모델 복잡도를 크게 감소시키면서도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we propose a transformer-based architecture, called two-stage transformer neural network (TSTNN) for end-to-end speech denoising in the time domain. The proposed model is composed of an encoder, a two-stage transformer module (TSTM), a masking module and a decoder. The encoder maps input noisy speech into feature representation. The TSTM exploits four stacked two-stage transformer blocks to efficiently extract local and global information from the encoder output stage by stage. The masking module creates a mask which will be multiplied with the encoder output. Finally, the decoder uses the masked encoder feature to reconstruct the enhanced speech. Experimental results on the benchmark dataset show that the TSTNN outperforms most state-of-the-art models in time or frequency domain while having significantly lower model complexity.

연구 동기 및 목표

  • 시간 도메인에서 직접 작동하는 저복잡도 엔드 투 엔드 음성 향상 모델을 개발하기 위해.
  • 노이즈가 섞인 음성에서 국소적이고 전반적인 시간적 의존성을 효과적으로 캡처하여 음성 품질과 이해도를 향상시키기 위해.
  • 기존의 트랜스포머 기반 또는 CNN 기반 음성 향상 아키텍처에 비해 모델 복잡도를 감소시키기 위해.
  • 시간 도메인 및 주파수 도메인 양쪽에서 최신 기술 수준의 모델들과 경쟁하거나 슈퍼어리어 성능을 달성하기 위해.

제안 방법

  • 모델 아키텍처는 인코더, 두 단계 트랜스포머 모듈(TSTM), 마스킹 모듈, 디코더로 구성되어 있다.
  • TSTM는 인코더 출력에서 계층적인 표현을 점진적으로 추출하기 위해 네 개의 스택된 두 단계 트랜스포머 블록을 활용한다.
  • 각 두 단계 트랜스포머 블록은 두 단계로 기능한다: 먼저 국소적 맥락을 캡처하고, 그 다음 자기주의(Self-attention)를 통해 장거리 의존성을 모델링한다.
  • 마스킹 모듈은 시간 도메인 마스크를 생성하여 인코더 출력과 요소별 곱셈을 수행함으로써 노이즈 성분을 억제한다.
  • 디코더는 역합성 컨볼루션(Transposed convolutions)을 사용하여 마스킹된 특징 표현에서 향상된 음성 신호를 복원한다.
  • 전체 네트워크는 강화된 음성과 청소된 음성 웨이브폼 간의 차이를 최소화하는 손실 함수를 사용해 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1두 단계 트랜스포머 아키텍처는 시간 도메인 음성 향상에서 노이즈가 섞인 음성의 국소적 및 전반적인 시간 패턴을 효과적으로 모델링할 수 있는가?
  • RQ2제안된 TSTNN은 목적적 지표 측면에서 기존 최신 기술 수준의 모델들보다 더 나은 음성 향상 성능을 달성하는가?
  • RQ3두 단계 설계는 성능을 유지하거나 향상시키면서 모델 복잡도를 어느 정도 감소시키는가?
  • RQ4마스킹 모듈은 노이즈 억제와 음성 복원 정밀도에 어떤 기여를 하는가?

주요 결과

  • TSTNN는 PESQ 및 STOI와 같은 목적적 음성 품질 지표 측면에서 기준 데이터셋에서 최신 기술 수준의 성능을 달성한다.
  • 시간 도메인에서 CNN 기반 및 트랜스포머 기반 베이스라인과 비교해도 TSTNN는 더 뛰어난 노이즈 억제 및 음성 복원 품질을 보여준다.
  • 유사한 트랜스포머 기반 모델들에 비해 TSTNN는 훨씬 낮은 모델 복잡도를 달성하여 파라미터 수와 FLOPs를 감소시켰다.
  • 제거 실험(Ablation study)을 통해 두 단계 설계가 특징 표현 학습을 향상시켜 더 나은 향상 성능에 기여한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.