Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Modal Hybrid Deep Neural Network for Speech Enhancement

Zhenhua Wu, Sunil Sivadas|arXiv (Cornell University)|2016. 06. 15.
Speech and Audio Processing참고 문헌 21인용 수 13
한 줄 요약

이 논문은 소음이 있는 환경에서 음성 품질을 향상시키기 위해 완전 연결 DNN에서 추출한 음성 특징과 CNN에서 추출한 시각적 특징을 융합하는 새로운 다중모달 하이브리드 딥 네트워크인 BiModal-BiLSTM을 제안한다. 이는 이원방향 LSTM을 사용하여 장기적 의존성을 모델링한다. 모델은 PESQ 측정 기준으로 뛰어난 음성 품질을 달성하였으며, 비정상적인 소음 조건에서도 특히 효과적임을 입증한다. 이는 음성-시각 융합이 음성 강화에 효과적임을 보여준다.

ABSTRACT

Deep Neural Networks (DNN) have been successful in en- hancing noisy speech signals. Enhancement is achieved by learning a nonlinear mapping function from the features of the corrupted speech signal to that of the reference clean speech signal. The quality of predicted features can be improved by providing additional side channel information that is robust to noise, such as visual cues. In this paper we propose a novel deep learning model inspired by insights from human audio visual perception. In the proposed unified hybrid architecture, features from a Convolution Neural Network (CNN) that processes the visual cues and features from a fully connected DNN that processes the audio signal are integrated using a Bidirectional Long Short-Term Memory (BiLSTM) network. The parameters of the hybrid model are jointly learned using backpropagation. We compare the quality of enhanced speech from the hybrid models with those from traditional DNN and BiLSTM models.

연구 동기 및 목표

  • 입술 움직임에서 유도된 시각적 신호를 활용하여 소음 환경에서의 음성 강화를 향상시키기 위해.
  • 단일 모달 모델의 한계를 극복하기 위해 음성과 시각 모달을 통합한 유일한 딥 러닝 프레임워크를 제안하기 위해.
  • 이원방향 LSTM 아키텍처를 사용하여 음성-시각 특징의 장기적 시간적 의존성을 모델링하기 위해.
  • 엔드 투 엔드 학습을 위해 역전파를 사용하여 하이브리드 모델의 파라미터를 공동 최적화하기 위해.
  • 모델의 성능을 볼 수 있는 소음 유형과 볼 수 없는 소음 유형 모두에서 검증하여 강건성과 일반화 능력을 입증하기 위해.

제안 방법

  • 노이즈가 섞인 음성 프레임의 윈도우에서 완전 연결 DNN를 사용해 음향 특징을 추출한다.
  • 입술 이미지인 시각 입력을 처리하기 위해 컨볼루션 신경망(CNN)을 사용해 고차원 공간 표현을 추출한다.
  • 각 타임스텝에서 음성 및 시각 특징을 결합하여 다중모달 융합을 위한 통합 표현을 생성한다.
  • 결합된 특징을 이원방향 장기 단기 기억망(BiLSTM) 네트워크를 통해 처리하여 과거 및 미래의 맥락을 모델링한다.
  • BiLSTM 출력에서 증강된 스펙트럼 특징을 복원하기 위해 최종 완전 연결 층을 사용한다.
  • Adam 최적화와 평균 제곱 오차 손실을 사용하여 역전파를 통해 전체 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1시각적 신호의 통합이 소음 환경에서 음성 강화 성능을 향상시킬 수 있는가?
  • RQ2DNN, CNN, BiLSTM를 융합한 하이브리드 아키텍처가 단일 모달 DNN 및 BiLSTM 모델보다 음성 강화에서 어떻게 비교되는가?
  • RQ3시각적 특징이 음성 세그먼트와 침묵 기간 동안 소음을 얼마나 효과적으로 억제하는가?
  • RQ4BiModal-BiLSTM 모델은 교통 소음과 같은 볼 수 없는 소음 유형에 잘 일반화되는가?
  • RQ5다중모달 특징의 공동 최적화가 청소된 음성 스펙트럼을 재구성하는 데 모델의 능력에 어떤 영향을 미치는가?

주요 결과

  • BiModal-BiLSTM 모델은 검증 세트에서 가장 낮은 평균 제곱 오차(MSE)를 기록하여 더 높은 특징 재구성 정확도를 보였다.
  • 모든 SNR 수준과 소음 유형에서 단일 채널 DNN 및 BiLSTM 기준 모델보다 PESQ 점수에서 뛰어난 성능을 보였다.
  • 알람 및 군중 소음과 같은 볼 수 있는 소음 조건에서는 BiLSTM 기준 모델보다 유의미하게 높은 평균 PESQ 점수를 기록하였다.
  • 볼 수 없는 교통 소음 조건에서도 BiModal-BiLSTM는 강력한 성능을 유지하였지만, BiLSTM 기준 모델 대비 성능 향상 폭은 더 작았다.
  • 스펙트로그램 비교 결과, 모델은 뿐만 아니라 활성 세그먼트에서 더 많은 음성 세부 정보를 유지하는 것으로 나타났다.
  • 모델는 스펙트럼 겹침이 높은 비정상적인 소음 환경에서도 시각 정보가 음성 강화에 의미 있는 기여를 한다는 것을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.