Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time Denoising and Dereverberation with Tiny Recurrent U-Net

Hyeong-Seok Choi, Sungjin Park|arXiv (Cornell University)|2021. 02. 05.
Speech and Audio Processing참고 문헌 31인용 수 10
한 줄 요약

이 논문은 단일 스테이지, 엔드 투 엔드 프레임워크에서 동시에 노이즈 제거와 리버버버레이션 제거를 수행할 수 있는 경량 실시간 음성 향상 모델인 트리플리 레이어드 리커런트 U-넷(TRU-Net)을 제안한다. 단일 주파수축 U-넷 아키텍처와 단일 주파수축 게이트드 리커런트 유닛(FGRU)을 사용하여 스펙트럼적 의존성을 효율적으로 모델링하고, 위상 인식 $\beta$-시그모이드 마스크를 통해 복소수 마스크를 생성한다. 총 0.38만 개의 파라미터와 362KB의 양자화된 크기를 가진 TRU-Net은 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하면서도 엣지 디바이스에서 저지연, 온라인 추론을 가능하게 한다.

ABSTRACT

Modern deep learning-based models have seen outstanding performance improvement with speech enhancement tasks. The number of parameters of state-of-the-art models, however, is often too large to be deployed on devices for real-world applications. To this end, we propose Tiny Recurrent U-Net (TRU-Net), a lightweight online inference model that matches the performance of current state-of-the-art models. The size of the quantized version of TRU-Net is 362 kilobytes, which is small enough to be deployed on edge devices. In addition, we combine the small-sized model with a new masking method called phase-aware $β$-sigmoid mask, which enables simultaneous denoising and dereverberation. Results of both objective and subjective evaluations have shown that our model can achieve competitive performance with the current state-of-the-art models on benchmark datasets using fewer parameters by orders of magnitude.

연구 동기 및 목표

  • 엣지 디바이스에 배포 가능한 경량 실시간 음성 향상 모델을 개발하기 위해.
  • 단일 단계, 엔드 투 엔드 프레임워크에서 동시에 노이즈 제거와 리버버버레이션 제거를 수행할 수 있도록 하기 위해.
  • 최신 기술 수준의 모델들과 비교해 성능을 저하시키지 않으면서도 모델 크기와 계산 복잡도를 줄이기 위해.
  • 인과적 아키텍처를 통해 룩어헤드 지연이 없는 온라인 추론을 지원하기 위해.
  • 위상 인식 마스크와 다중 척도 목표 함수를 통해 강인성과 청취 품질을 향상시키기 위해.

제안 방법

  • TRU-Net은 주파수축 U-넷 아키텍처에 1D-CNN과 주파수축 게이트드 리커런트 유닛(FGRU)을 적용하여 스펙트럼적 의존성을 효율적으로 모델링한다.
  • 시간축 게이트드 리커런트 유닛(TGRU)을 사용하여 주파수 빈도 간에 공유된 파rameter를 활용해 시간적 동역학을 포착한다.
  • 스트라이드 1D-컨볼루션과 스킵 연결을 적용하여 특징 맵의 다운샘플링 및 업샘플링을 수행하면서 해상도를 유지한다.
  • 위상 인식 $\beta$-시그모이드 마스크(PHM)를 도입하여 혼합 신호, 목표 신호, 잔여 신호 간의 삼각 관계를 강제함으로써 동시에 노이즈 제거와 리버버버레이션 제거를 가능하게 한다.
  • 동적 범위를 줄이고 음량 변동에 대한 강인성을 향상시키기 위해 입력으로 PCEN(채널별 에너지 정규화)을 사용한다.
  • 양자화를 통한 모델 압축을 통해 최종 모델 크기를 362KB로 줄여 모바일 및 임베디드 디바이스에의 배포를 가능하게 한다.

실험 결과

연구 질문

  • RQ1경량 레이어드 리커런트 U-넷 아키텍처가 최소한의 지연으로 실시간 온라인 음성 향상을 달성할 수 있는가?
  • RQ2단일 모델이 통합된 마스크 전략을 통해 효과적으로 동시에 노이즈 제거와 리버버버레이션 제거를 수행할 수 있는가?
  • RQ3제안된 위상 인식 $\beta$-시그모이드 마스크는 기존의 위상 재사용 방법에 비해 성능을 어떻게 향상시키는가?
  • RQ40.38만 개의 파라미터를 가진 소형 모델이 더 큰 최신 기술 수준의 모델들과 비교해 얼마나 높은 성능을 달성할 수 있는가?
  • RQ5PCEN과 다중 척도 목표 함수의 사용이 어려운 조건에서 강인성과 청취 품질을 향상시키는가?

주요 결과

  • 합성 리버버버레이션 없는 데이터셋에서 TRU-Net은 훨씬 적은 파라미터를 가진 다른 모델들 중에서 최고의 PESQ 점수(2.51)를 기록했다.
  • 합성 리버버버레이션 있는 데이터셋에서 TRU-Net은 파라미터 수가 수 개의 주요 차수만큼 적은 다른 모델들보다 뛰어난 성능을 보였으며, PESQ 2.51과 SI-SDR 3.51을 달성했다.
  • WHAMR 데이터셋에서 TRU-Net(FP32)은 청취 테스트에서 MOS 3.32를 기록하여 베이스라인 모델인 NSnet2(MOS 3.21)를 초월했다.
  • 2.7GHz CPU에서 TRU-Net은 단일 프레임을 1.97ms 내로 처리하여 룩어헤드 지연이 없는 실시간 배포에 적합하다.
  • 양자화된 TRU-Net(INT8)는 모델 크기를 0.36MB로 줄였지만 높은 성능을 유지하여 엣지 배포를 가능하게 했다.
  • 위상 인식 $\beta$-시그모이드 마스크는 혼합 신호, 목표 신호, 잔여 신호 구성 요소 간의 기하학적 관계를 강제함으로써 신호의 무결성을 효과적으로 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.