Skip to main content
QUICK REVIEW

[논문 리뷰] A Time-domain Monaural Speech Enhancement with Feedback Learning

Andong Li, Chengshi Zheng|arXiv (Cornell University)|2020. 03. 22.
Speech and Audio Processing참고 문헌 36인용 수 11
한 줄 요약

이 논문은 피드백 학습을 사용하여 파rameter를 줄이고 성능을 향상시키기 위해 시간 도메인 단음성 음성 향상 네트워크인 FTNet을 제안한다. 중간 추정치를 게이트드 선형 단위와 복소수 자동에코더를 갖춘 단계별 순환 네트워크에 반복적으로 피드백하여, FTNet은 단지 102만 개의 훈련 가능한 파rameter로 최신 기술 수준의 PESQ 및 STOI 점수를 달성한다—기존의 기준보다 훨씬 적은 수치로, 이는 높은 파rameter 효율성과 점진적인 노이즈 제거를 보여준다.

ABSTRACT

In this paper, we propose a type of neural network with feedback learning in the time domain called FTNet for monaural speech enhancement, where the proposed network consists of three principal components. The first part is called stage recurrent neural network, which is introduced to effectively aggregate the deep feature dependencies across different stages with a memory mechanism and also remove the interference stage by stage. The second part is the convolutional auto-encoder. The third part consists of a series of concatenated gated linear units, which are capable of facilitating the information flow and gradually increasing the receptive fields. Feedback learning is adopted to improve the parameter efficiency and therefore, the number of trainable parameters is effectively reduced without sacrificing its performance. Numerous experiments are conducted on TIMIT corpus and experimental results demonstrate that the proposed network can achieve consistently better performance in terms of both PESQ and STOI scores than two state-of-the-art time domain-based baselines in different conditions.

연구 동기 및 목표

  • 기존 시간 도메인 음성 향상 모델의 높은 파arameter 수와 계산 비용 문제를 해결하기 위해.
  • 경량 순환 아키텍처를 사용하여 노이즈 환경에서 음성 품질과 이해도를 향상시키기 위해.
  • 피드백 학습을 활용하여 단계 간의 이전 지식을 누적시켜 향상된 음성의 점진적 개선을 달성하기 위해.
  • 최소한의 훈련 가능한 파arameter로 뛰어난 성능을 달성하여 실세계 구현을 위한 모델 효율성을 향상시키기 위해.

제안 방법

  • 메모리 메커니즘을 통해 다중 향상 단계 간의 깊은 특징 종속성을 수집하기 위해 단계별 순환 신경망(SRNN)을 사용한다.
  • 각 단계의 추정 출력을 이전 정보로 반복적으로 피드백하여 피드백 학습을 구현함으로써 점진적 개선을 가능하게 한다.
  • 잠재 공간에서의 특징 추출 및 표현 학습을 위해 복소수 자동에코더(CAE)를 사용한다.
  • 연결된 게이트드 선형 단위(GLUs)를 스택하여 수용 영역를 확장하고 정보 흐름을 효율적으로 제어한다.
  • 청각적 품질과 이해도를 동시에 최적화하기 위해 다단계 손실 함수를 사용하여 엔드 투 엔드로 훈련한다.
  • 피드백 메커니즘은 단계 간에 파aram터를 재사용함으로써 총 훈련 가능한 파aram터 수를 크게 줄이면서 성능 손실 없이 구현한다.

실험 결과

연구 질문

  • RQ1피드백 학습은 성능 손실 없이 시간 도메인 음성 향상 네트워크의 파aram터 효율성을 향상시킬 수 있는가?
  • RQ2단계별 피드백을 통한 점진적 개선이 PESQ 및 STOI와 같은 음성 품질 및 이해도 지표에 어떤 영향을 미치는가?
  • RQ3피드백 학습을 갖춘 경량 네트워크는 깊고 파aram터가 많은 최신 기술 수준의 모델보다 단일 음성 향상에서 얼마나 뛰어난 성능을 낼 수 있는가?
  • RQ4단계 간의 이전 정보 누적은 SRNN의 은닉 상태 표현에 어떤 영향을 미치는가?

주요 결과

  • FTNet는 볼 수 있는가, 볼 수 없는 노이즈 조건을 포함하여 두 개의 최신 기술 수준의 시간 도메인 기준 모델보다 일관되게 높은 PESQ 및 STOI 점수를 달성한다.
  • 훈련 가능한 파aram터 수를 102만 개로 줄여, AECNN(631만 개) 및 RHR-Net(195만 개)보다 훨씬 낮게 유지함으로써 높은 파aram터 효율성을 입증한다.
  • 피드백을 통한 점진적 개선은 뚜렷한 성능 향상을 가져옴: -5dB SNR 조건에서 첫 번째 단계의 PESQ는 1.06에서 다섯 번째 단계로 1.83으로 상승한다.
  • 스펙트럼 시각화 결과, 노이즈 성분이 단계 간 점차 감소하고, 후속 단계에서 더 명확한 음성 특징이 나타남을 확인할 수 있다.
  • 은닉 상태 시각화 결과, SRNN 표현이 피드백 단계가 많아질수록 점점 더 선명하고 흐릿하지 않게 되며, 깨끗한 음성 사전 지식을 효과적으로 학습하고 있음을 나타낸다.
  • 피드백 메커니즘 덕분에 파aram터 재사용으로 인해 파aram터 수를 늘리지 않고도 효과적인 네트워크 깊이를 28×Q 레이어로 확장할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.