Skip to main content
QUICK REVIEW

[논문 리뷰] TFCN: Temporal-Frequential Convolutional Network for Single-Channel Speech Enhancement

Xupeng Jia, Dongmei Li|arXiv (Cornell University)|2022. 01. 03.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 단일 채널 음성 향상에 적합한 경량의 시간-주파수 컨볼루션 네트워크인 TFCN을 제안한다. TFCN는 2D 확장형 및 디프스와이즈 분리형 컨볼루션을 사용하여 시간-주파수 특징을 효율적으로 모델링한다. 오직 93,000개의 파라미터만을 사용함으로써 STOI(0.943), PESQ(3.00), 복합 지표에서 최신 기술 수준의 성능을 달성하며, UNet 및 TCN-LPS와 같은 더 큰 모델들을 능가한다. 또한 인과적 및 반인과적 환경에서 저지연 추론을 가능하게 한다.

ABSTRACT

Deep learning based single-channel speech enhancement tries to train a neural network model for the prediction of clean speech signal. There are a variety of popular network structures for single-channel speech enhancement, such as TCNN, UNet, WaveNet, etc. However, these structures usually contain millions of parameters, which is an obstacle for mobile applications. In this work, we proposed a light weight neural network for speech enhancement named TFCN. It is a temporal-frequential convolutional network constructed of dilated convolutions and depth-separable convolutions. We evaluate the performance of TFCN in terms of Short-Time Objective Intelligibility (STOI), perceptual evaluation of speech quality (PESQ) and a series of composite metrics named Csig, Cbak and Covl. Experimental results show that compared with TCN and several other state-of-the-art algorithms, the proposed structure achieves a comparable performance with only 93,000 parameters. Further improvement can be achieved at the cost of more parameters, by introducing dense connections and depth-separable convolutions with normal ones. Experiments also show that the proposed structure can work well both in causal and non-causal situations.

연구 동기 및 목표

  • 모바일 및 실시간 음성 향상 응용 분야에 고파라미터 딥 러닝 모델을 구현하는 데 도전하는 문제를 해결하기 위해.
  • TCN 유사 아키텍처에서 1D 컨볼루션을 2D 컨볼루션으로 대체하여 시간-주파수 음성 향상에서 파라미터 효율성을 향상시키기 위해.
  • 기존의 UNet 및 TCN 기반 방법들에 비해 모델 크기를 크게 줄였음에도 불구하고 높은 청취자 품질과 이해도를 유지하기 위해.
  • 실시간 적용 가능성을 평가하기 위해 인과적, 반인과적, 비인과적 추론 시나리오 전반에서 모델 성능을 평가하기 위해.

제안 방법

  • TFCN는 TCN의 1D 확장형 컨볼루션을 2D 컨볼루션으로 대체하여 로그 파wer 스펙트럼(LPS)에서 시간적 및 스펙트럼적 특징을 동시에 모델링한다.
  • 깊이 분리형 컨볼루션을 도입하여 파라미터 수를 감소시키면서도 확장형 컨볼루션을 통해 수용 영역 확장을 유지한다.
  • 반복 블록 간에 밀집 연결(dense connections)을 도입하여 특징 전파를 향상시키고 성능을 개선한다.
  • 학습은 Adam 옵timizer를 사용하며, 조기 정지와 학습률 감소 전략을 적용하고, 배치 학습을 위해 2초 분량의 음성 세그먼트를 사용한다.
  • 시스템은 노이즈가 섞인 입력 LPS에서 청소된 음성 LPS를 추정하고, 노이즈가 섞인 위상과 조합하여 향상된 음성 신호를 복원한다.
  • 비인과적, 반인과적(304ms 및 48ms의 앞서보기), 그리고 인과적 설정에서 아키텍처를 평가하여 지연 시간의 상호 교환 관계를 분석한다.

실험 결과

연구 질문

  • RQ12D 컨볼루션 아키텍처가 1D TCN 기반 모델보다 훨씬 적은 파라미터로 시간-주파수 음성 향상에서 뛰어난 성능을 낼 수 있는가?
  • RQ2깊이 분리형 컨볼루션과 2D 컨볼루션의 사용이 LPS 매핑에서 파라미터 효율성과 성능에 어떤 영향을 미치는가?
  • RQ3모델 크기를 늘리지 않고도 밀집 연결을 도입함으로써 성능 향상 정도는 어느 정도인가?
  • RQ4모델이 인과적 및 반인과적 추론 조건에서 어떻게 작동하는가? 지연 시간에 어떤 영향을 미치는가?

주요 결과

  • TFCN는 STOI 0.943, PESQ 3.00, Csig 4.38, Cbak 3.44, Covl 3.71를 달성하며, TCN-LPS를 능가하고 UNet 및 Affinity와 유사하거나 뛰어난 성능을 보였다.
  • 오직 93,000개의 파라미터만을 사용함으로써 TFCN는 TCN-LPS(864만 파라미터)의 1.1%로 모델 크기를 극도로 줄여 높은 파라미터 효율성을 입증했다.
  • 일반 컨볼루션과 밀집 연결을 사용하는 TFCN-d는 138만 개의 파라미터로도 최고의 성능을 기록했으며, STOI 0.948, PESQ 3.06, Csig 4.44를 달성했다.
  • 304ms 앞서보기 시간을 가진 반인과적 버전은 성능 저하가 거의 없었으며(STOI: 0.945, PESQ: 3.04) 실시간 응용에 적합함을 시사했다.
  • 인과적 버전은 성능 저하가 눈에 띄게 나타났지만 크기는 작았으며(STOI: 0.940, PESQ: 2.91) TFCN가 저지연 환경에서의 실현 가능성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.