Skip to main content
QUICK REVIEW

[논문 리뷰] Dual-path Self-Attention RNN for Real-Time Speech Enhancement

Ashutosh Pandey, DeLiang Wang|arXiv (Cornell University)|2020. 10. 23.
Speech and Audio Processing참고 문헌 22인용 수 13
한 줄 요약

이 논문은 시간 도메인 음성 향상 모델인 이중경로 자기주의 RNN(DP-SARNN)을 제안한다. 이는 이중경로 RNN(DP-RNN)의 RNN을 자기주의 RNN(SARNN)으로 대체하여 장거리 시퀀스 모델링을 향상시킨다. 네 배 더 큰 프레임 시프트와 인과적 어텐션을 사용함으로써 DP-SARNN는 32ms의 신호 청크당 7.9ms의 지연으로 실시간 처리를 달성하며, 오프라인 및 실시간 설정 모두에서 이전 방법들을 능가한다.

ABSTRACT

We propose a dual-path self-attention recurrent neural network (DP-SARNN) for time-domain speech enhancement. We improve dual-path RNN (DP-RNN) by augmenting inter-chunk and intra-chunk RNN with a recently proposed efficient attention mechanism. The combination of inter-chunk and intra-chunk attention improves the attention mechanism for long sequences of speech frames. DP-SARNN outperforms a baseline DP-RNN by using a frame shift four times larger than in DP-RNN, which leads to a substantially reduced computation time per utterance. As a result, we develop a real-time DP-SARNN by using long short-term memory (LSTM) RNN and causal attention in inter-chunk SARNN. DP-SARNN significantly outperforms existing approaches to speech enhancement, and on average takes 7.9 ms CPU time to process a signal chunk of 32 ms.

연구 동기 및 목표

  • 소음 환경에서 저지연, 실시간 음성 향상에 대한 필요를 해결한다.
  • 이중경로 RNN에 어텐션을 통합하여 시간 도메인 음성 향상에서 장거리 시퀀스 모델링을 향상시킨다.
  • 처리 지연과 계산 비용을 줄이되, 품질을 유지하거나 향상시킨다.
  • 기존 시간 도메인 접근 방식을 능가하는 인과적 실시간 추론 기능을 갖춘 모델을 개발한다.
  • 미래의 탐색을 통해 제안된 아키텍처의 교차 코퍼스 일반화 능력을 확보한다.

제안 방법

  • 최근에 제안된 자기주의 RNN(SARNN)을 이중경로 RNN(DP-RNN)에 통합하여 청크 간 및 청크 내 모델링을 향상시킨다.
  • 학습 가능한 쿼리, 키, 밸류 벡터를 통해 RNN과 효율적인 파라미터 어텐션 메커니즘을 결합한 SARNN 블록을 사용한다.
  • 학습 안정성과 기울기 흐름 향상을 위해 잔차 연결과 레이어 정규화를 적용한다.
  • 청크 간 SARNN에 인과적 어텐션을 구현하여 실시간 추론 능력을 확보한다.
  • 기본값 DP-RNN보다 네 배 더 큰 프레임 시프트(8ms 대비 2ms)를 사용하여 처리 부담과 지연을 줄인다.
  • 빠른 수렴을 위해 위상 제약이 있는 크기(PCM) 손실과 혼합 정밀도 학습을 사용한다.

실험 결과

연구 질문

  • RQ1자기주의 어텐션 메커니즘은 시간 도메인 음성 향상에서 이중경로 RNN의 장거리 시퀀스 모델링을 향상시킬 수 있는가?
  • RQ2DP-RNN에서 RNN을 SARNN로 대체함으로써 계산 비용을 줄일 수 있으며, 성능을 유지하거나 향상시킬 수 있는가?
  • RQ3인과적 SARNN 기반 아키텍처는 저지연으로 실시간 처리를 달성할 수 있는가?
  • RQ4제안된 DP-SARNN는 STOI 및 PESQ 점수 측면에서 최신 기술 시간 도메인 모델과 비교해 어떻게 성능을 내는가?
  • RQ5실시간 음성 향상에서 프레임 시프트를 늘일 경우 모델 성능과 지연에 어떤 영향을 미치는가?

주요 결과

  • DP-SARNN는 32ms 신호 청크당 평균 7.9ms의 CPU 처리 시간을 기록하여 실시간 응용에 적합하다.
  • 모델 복잡도가 더 높음에도 불구하고, DP-SARNN는 DCN(11.0ms)과 DP-RNN(17.4ms)보다 처리 속도가 빠르다.
  • 평균적으로 DP-SALSTM은 DCN 대비 STOI를 1.7% 향상시키고 PESQ를 0.15 향상시키며, -5dB SNR에서 가장 큰 향상을 보였다.
  • 비인과적 DP-SABLSTM 버전은 모든 모델 중에서 가장 높은 성능을 기록했으며, DP-BLSTM 및 기타 기준 모델을 초월하는 STOI와 PESQ 점수를 확보했다.
  • DP-SALSTM은 지연을 줄이면서도 뛰어난 성능을 유지했으며, 어텐션과 함께 더 큰 프레임 시프트를 사용해 품질을 유지할 수 있음을 보여주었다.
  • 모델은 다양한 소음 유형과 SNR 수준에서 뛰어난 성능을 보였으며, 배블리 및 카페터리아 소음을 포함한 테스트 세트에서 강력한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.