Skip to main content
QUICK REVIEW

[논문 리뷰] A Fully Convolutional Neural Network Approach to End-to-End Speech Enhancement

Frank Longueira, Sam Keene|arXiv (Cornell University)|2018. 07. 20.
Speech and Audio Processing참고 문헌 12인용 수 5
한 줄 요약

이 논문은 원시 음성 신호를 직접 처리하여 스펙트로그램 계산을 생략하고 위상 정보를 유지하는 엔드 투 엔드 음성 향상용 완전 컨volution 신경망(FCN)을 제안한다. 이 모델은 배배잡힌 잡음 환경에서 강건한 음성 분리 성능을 보이며, 미세조정을 통해 새로운 화자로의 일반화가 가능하며, 미세조정 후 -5 dB SNR에서 PESQ 점수는 2.283(기존 1.437)으로 향상되고 WER는 58.69%(기존 89.305%)로 감소한다.

ABSTRACT

This paper will describe a novel approach to the cocktail party problem that relies on a fully convolutional neural network (FCN) architecture. The FCN takes noisy audio data as input and performs nonlinear, filtering operations to produce clean audio data of the target speech at the output. Our method learns a model for one specific speaker, and is then able to extract that speakers voice from babble background noise. Results from experimentation indicate the ability to generalize to new speakers and robustness to new noise environments of varying signal-to-noise ratios. A potential application of this method would be for use in hearing aids. A pre-trained model could be quickly fine tuned for an individuals family members and close friends, and deployed onto a hearing aid to assist listeners in noisy environments.

연구 동기 및 목표

  • 다양한 화자가 존재하는 잡음 환경에서 목표 음성을 향상시켜 칵테일 파티 문제를 해결한다.
  • 스펙트로그램과 같은 중간 특징 추출 과정을 생략하는 엔드 투 엔드 음성 향상 시스템을 개발한다.
  • 원시 음성을 직접 처리하여 출력 시 위상 정보를 유지함으로써 청취자 품질을 향상시킨다.
  • 최소한의 미세조정 데이터를 사용하여 새로운 화자로의 일반화를 입증한다.
  • 파rameter 효율적인 완전 컨볼루션 아키텍처를 통해 청취 보조기기에서 실시간 구동을 가능하게 한다.

제안 방법

  • 완전 컨볼루션 신경망(FCN)을 사용하여 16 kHz 단일 채널 원시 음성을 직접 처리한다. 완전 연결층은 포함하지 않는다.
  • 컨볼루션 정리를 활용하여 FCN을 시간 도메인에서 작동하는 학습 가능한 비선형 필터 베드로 간주한다.
  • 다양한 SNR에서 깨끗한 음성(Pamela의 독서)과 배배잡힌 잡음(바와 카페 환경)을 혼합하여 모델을 훈련시킨다.
  • 중간 특징 공학을 생략하고, 노이즈가 섞인 시간 도메인 입력을 깨끗한 시간 도메인 출력으로 매핑하는 엔드 투 엔드 훈련을 수행한다.
  • 새로운 화자(Tricia)의 5분 분량 데이터를 사용하여 사전 훈련된 모델을 미세조정하여 새로운 화자에 적응시킨다.
  • 위상 보존과 향상된 청취 품질을 위해 시간 도메인 손실 함수를 사용한다.

실험 결과

연구 질문

  • RQ1한 화자에서 훈련된 완전 컨볼루션 신경망이 새로운 화자에게서 잡음 환경에서 일반화 가능한가?
  • RQ2새로운 화자로부터 최소한의 데이터로 미세조정을 수행할 경우 사전 훈련된 음성 향상 모델의 성능에 어떤 영향을 미치는가?
  • RQ3모델이 다양한 신호 대 잡음 비율(SNR)에 대해 얼마나 강건한가?
  • RQ4스펙트로그램 기반 접근 방식에 비해 원시 음성의 엔드 투 엔드 처리 방식이 위상 보존과 품질 향상 측면에서 더 우수한가?
  • RQ5FCN 기반 시스템의 실시간 구동을 위한 계산 및 저장 용량 효율성은 어떠한가?

주요 결과

  • 미세조정 후 -5 dB SNR에서 새로운 화자(Tricia)에 대해 PESQ 점수는 2.283으로 기존 1.437에서 향상되었다.
  • 미세조정 후 -5 dB SNR에서 새로운 화자에 대한 WER는 58.69%로 기존 89.305%에서 감소하였다.
  • 새로운 잡음 환경으로의 일반화가 잘 이루어져 -5 dB에서 5 dB까지의 다양한 SNR 범위에서 강력한 성능 유지를 보였다.
  • 단지 5분 분량의 새로운 화자 데이터로 미세조정을 수행함으로써 성능 향상이 크게 이루어졌으며, 동일 화자로 훈련된 모델과 유사한 성능을 달성했다.
  • FCN 아키텍처는 모델 복잡도를 감소시켜 STFT 계산이 필요 없고, 더 적은 파라미터로 인해 실시간 구동이 가능하게 하였다.
  • 주관적 청취 테스트 결과, 음성의 명료성과 품질 향상이 확인되어 객관적 지표와 일치하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.