Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time speech enhancement using equilibriated RNN

Daiki Takeuchi, Kohei Yatabe|arXiv (Cornell University)|2020. 02. 14.
Speech and Audio Processing참고 문헌 27인용 수 4
한 줄 요약

이 논문은 인과적 평형화된 순환 신경망(ERNN)을 사용하여 LSTM 수준의 성능를 달성하면서도 파rameter 수를 크게 줄인 실시간 음성 향상 방법을 제안한다. 게이트 단위 없이 반복적 가중치 공유를 활용하여 기울기를 안정화함으로써, 자원이 제한된 장치에 적합한 효율적이고 저복잡도의 추론을 가능하게 하면서도 높은 품질의 음성 향상을 유지한다.

ABSTRACT

We propose a speech enhancement method using a causal deep neural network~(DNN) for real-time applications. DNN has been widely used for estimating a time-frequency~(T-F) mask which enhances a speech signal. One popular DNN structure for that is a recurrent neural network~(RNN) owing to its capability of effectively modelling time-sequential data like speech. In particular, the long short-term memory (LSTM) is often used to alleviate the vanishing/exploding gradient problem which makes the training of an RNN difficult. However, the number of parameters of LSTM is increased as the price of mitigating the difficulty of training, which requires more computational resources. For real-time speech enhancement, it is preferable to use a smaller network without losing the performance. In this paper, we propose to use the equilibriated recurrent neural network~(ERNN) for avoiding the vanishing/exploding gradient problem without increasing the number of parameters. The proposed structure is causal, which requires only the information from the past, in order to apply it in real-time. Compared to the uni- and bi-directional LSTM networks, the proposed method achieved the similar performance with much fewer parameters.

연구 동기 및 목표

  • 제한된 계산 자원을 가진 실시간 애플리케이션에 딥러닝 기반 음성 향상을 구현하는 데 도전한다.
  • 모델 복잡도를 증가시키지 않고도 순환 네트워크에서 기울기 소실/폭발 문제를 극복한다.
  • 장기적인 시간적 의존성을 유지하면서도 파rameter 수를 최소화하는 인과적 RNN 아키텍처를 개발한다.
  • 모델 크기를 줄임으로써 엣지 디바이스에서의 효율적 추론을 가능하게 하되, 향상 품질을 손상시키지 않는다.
  • ERNN이 프루닝된 LSTM 모델에 비해 성능 및 효율성의 트레이드오프에서 뛰어난 성능을 보임을 입증한다.

제안 방법

  • 기울기를 안정화하기 위해 동일한 완전 연결 층을 은닉 상태에 반복적으로 적용하는 평형화된 순환 신경망(ERNN)을 사용한다.
  • 과거 정보만 사용함으로써 인과성을 확보하여 실시간 처리에 적합한 네트워크를 만든다.
  • ERNN을 STFT 도메인 내의 T-F 마스크 추정기로 구현하며, 노이즈가 섞인 스펙트로그램에 마스크를 적용하여 향상된 음성을 복원한다.
  • 반복적 가중치 공유 메커니즘으로 기울기 안정성이 보장되는 백프로파게이션을 통해 네트워크를 훈련시킨다.
  • 반복 횟수 $K$와 은닉 차원 $N_{\rm h}$를 조절하여 모델 용량과 계산 비용을 제어한다.
  • ERNN 아키텍처의 기본 모듈 $\mathscr{F}$로 활성화 함수로 ReLU를 사용하는 완전 연결 DNN을 구현한다.

실험 결과

연구 질문

  • RQ1ERNN은 파arameter 수를 크게 줄였음에도 불구하고 LSTM 수준의 음성 향상 성능를 달성할 수 있는가?
  • RQ2게이트 단위 없이도 ERNN 아키텍처가 기울기 소실/폭발 문제를 효과적으로 완화하는가?
  • RQ3반복 횟수 $K$와 은닉 차원 $N_{\rm h}$가 성능와 계산 비용 간의 트레이드오프에 어떻게 영향을 미치는가?
  • RQ4낮은 파arameter 수에도 불구하고 ERNN은 실시간 응용에서 높은 품질의 향상을 유지할 수 있는가?
  • RQ5목표 지표와 파arameter 효율성 측면에서 ERNN은 인과적 LSTM과 비인과적 BLSTM에 비해 어떻게 성능를 보이는가?

주요 결과

  • 제안된 ERNN 기반 방법은 512점 STFT에서 PESQ 점수 2.54와 3.74를 기록하여, 파arameter 수를 1/14로 줄였음에도 불구하고 LSTM 성능를 맞추거나 초월했다.
  • 단지 231k개의 파arameter로도 ERNN은 PESQ 2.40과 CSIG 3.56을 달성하여 381만 개의 파arameter를 가진 LSTM과 유사한 성능를 보였다.
  • 유사한 파arameter 수를 가진 프루닝된 LSTM 모델보다 ERNN이 더 뛰어난 성능-복잡도 트레이드오프를 보였다.
  • 비인과적 BLSTM(실시간 사용 불가)에 근접한 성능를 달성하면서도 파arameter 수를 1/36 미만으로 줄였다.
  • 반복 횟수 $K$를 5에서 1로 줄여도 성능에 미미한 영향을 미쳐 추가적인 계산 절감이 가능했다.
  • 게이트 단위 없이도 ERNN 모델은 안정적인 기울기를 유지하여 낮은 파arameter 수에도 불구하고 장기적인 의존성을 효과적으로 학습할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.