Skip to main content
QUICK REVIEW

[논문 리뷰] On Psychoacoustically Weighted Cost Functions Towards Resource-Efficient Deep Neural Networks for Speech Denoising

Kai Zhen, Aswin Sivaraman|arXiv (Cornell University)|2018. 01. 29.
Speech and Audio Processing참고 문헌 17인용 수 3
한 줄 요약

이 논문은 인간 청각에 가장 민감한 주파수 대역을 강조함으로써 심리청각적으로 가중된 비용 함수를 제안하여, 깊은 신경망(DNN) 기반 음성 노이즈 제거에서 청각적 품질을 향상시킨다. 이 방법은 PAM-1 모델에서 유도된 마스킹 임계치를 활용하여 청각적으로 중요하지 않은 주파수 대역의 오차를 최소화한다. 이로 인해 더 단순하고 자원 효율적인 DNN 구조를 구현할 수 있으며, 복잡도가 감소함에도 불구하고 표준 MSE로 훈련된 모델보다 청각적 평가 지표에서 뛰어난 성능을 보인다.

ABSTRACT

We present a psychoacoustically enhanced cost function to balance network complexity and perceptual performance of deep neural networks for speech denoising. While training the network, we utilize perceptual weights added to the ordinary mean-squared error to emphasize contribution from frequency bins which are most audible while ignoring error from inaudible bins. To generate the weights, we employ psychoacoustic models to compute the global masking threshold from the clean speech spectra. We then evaluate the speech denoising performance of our perceptually guided neural network by using both objective and perceptual sound quality metrics, testing on various network structures ranging from shallow and narrow ones to deep and wide ones. The experimental results showcase our method as a valid approach for infusing perceptual significance to deep neural network operations. In particular, the more perceptually sensible enhancement in performance seen by simple neural network topologies proves that the proposed method can lead to resource-efficient speech denoising implementations in small devices without degrading the perceived signal fidelity.

연구 동기 및 목표

  • 모바일 또는 임베디드 시스템과 같은 자원 제약이 있는 장치에 복잡한 DNN을 음성 노이즈 제거에 구현하는 데 도전하는 데 대비하기 위해.
  • 인간 청각 인지 특성을 활용하여 네트워크 복잡도를 증가시키지 않고도 노이즈 제거된 음성의 청각적 품질을 향상시키기 위해.
  • 청각적으로 중요한 주파수 성분을 우선시하고 청각적으로 무시할 수 있는 영역의 오차를 최소화하는 비용 함수를 개발하기 위해.
  • 청각 지향적 훈련이 더 단순한 네트워크 아키텍처가 더 깊고 큰 모델과 동등한 청각 성능을 달성할 수 있는지 평가하기 위해.
  • 청각 가중치가 청각적 음성 품질 손실 없이 더 효율적인 DNN을 가능하게 할 수 있는지 증명하기 위해.

제안 방법

  • 청소음 스펙트로그램에서 PAM-1 심리청각 모델을 사용하여 전반적인 마스킹 임계치를 계산하고, 청각적으로 중요하지 않은 주파수 대역을 식별한다.
  • 마스킹 임계치에서 유도된 청각적 가중치를 평균 제곱오차(MSE) 손실 함수에 적용하여 청각적으로 중요한 영역의 오차를 강조한다.
  • 각 주파수 대역의 기여도가 청각적 중요성에 따라 스케일링되는 심리청각적으로 가중된 MSE로 정의된 가중 비용 함수를 사용한다.
  • TensorFlow에서 Adam 옵timizer를 사용해 5,000 에포크 동안 훈련하며, 12개의 네트워크 아키텍처에서 가중 및 비가중 손실 함수를 비교한다.
  • 객관적 평가는 BSS-Eval 지표(SDR, SIR, SAR)를 사용하고, 청각적 평가는 PEASS 및 STOI를 활용하여 청각적 품질을 평가한다.
  • 모델 복잡도는 얕은(예: 256×2)에서 깊은(예: 1024×3)까지 다양하게 설정하여 다양한 아키텍처 간 성능 비교를 가능하게 한다.

실험 결과

연구 질문

  • RQ1청각적으로 가중된 비용 함수는 모델 복잡도를 감소시키면서도 DNN 기반 음성 노이즈 제거의 청각적 품질을 향상시킬 수 있는가?
  • RQ2다양한 네트워크 아키텍처에서 청각 가중치가 SDR, SIR, SAR와 같은 객관적 지표에 미치는 영향은 어떠한가?
  • RQ3얕고 좁은 네트워크에서 제안된 방법이 깊고 넓은 모델에 비해 청각적 품질을 얼마나 잘 유지하는가?
  • RQ4손실 함수에 심리청각적 마스킹 임계치를 적용하면 청각적 품질 저하 없이 더 효율적인 파라미터 사용이 가능한가?
  • RQ5청각 가중치는 실시간 임베디드 음성 향상 응용 분야에서 큰, 계산 비용이 높은 DNN의 필요성을 줄일 수 있는가?

주요 결과

  • 청각적으로 가중된 DNN는 훨씬 적은 파라미터를 사용함에도 불구하고, 비가중 모델과 비교해 동등하거나 더 높은 청각적 품질(OPS)을 달성했다.
  • SIR가 약 0.5 dB 감소했음에도 불구하고, 가중 모델은 더 낮은 청각적 불쾌감을 유발하는 아티팩트를 유발했으며, 이는 더 높은 APS 점수로 확인되었다.
  • STOI 점수는 가중 모델에서 약간 높아져서, 말의 명료성이 안정적이거나 향상된 것으로 나타났다.
  • 얕고 좁은 네트워크에서 청각 비용 함수를 사용한 결과, 복잡도 제약 조건 하에서 더 깊은 모델보다 청각 지표에서 뛰어난 성능을 보였다.
  • 이 방법은 더 큰 복잡한 DNN의 필요성을 줄임으로써 자원 효율적인 구현을 가능하게 하였으며, 청각적 품질 손실 없이도 성능을 유지했다.
  • 제안된 접근법은 심리청각 모델을 훈련 목표에 통합함으로써 더 효율적이고 청각적으로 강건한 음성 노이즈 제거 시스템을 구현할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.