Skip to main content
QUICK REVIEW

[논문 리뷰] Multichannel Speech Enhancement by Raw Waveform-mapping using Fully Convolutional Networks

Changle Liu, Szu‐Wei Fu|arXiv (Cornell University)|2019. 09. 26.
Speech and Audio Processing참고 문헌 64인용 수 4
한 줄 요약

이 논문은 Sinc 및 확장(convolution) 컨볼루션을 갖춘 완전 컨volution 신경망인 SDFCN과 rSDFCN을 제안하며, 시간 도메인에서 직접 다중채널 음성 강화를 수행한다. 스펙트럼 추정을 생략함으로써 이중채널 내이 및 분산 마이크로폰 설정에서 뛰어난 노이즈 제거 성능을 달성하며, 잔차 연결을 통해 성능이 더욱 향상된다.

ABSTRACT

In recent years, waveform-mapping-based speech enhancement (SE) methods have garnered significant attention. These methods generally use a deep learning model to directly process and reconstruct speech waveforms. Because both the input and output are in waveform format, the waveform-mapping-based SE methods can overcome the distortion caused by imperfect phase estimation, which may be encountered in spectral-mapping-based SE systems. So far, most waveform-mapping-based SE methods have focused on single-channel tasks. In this paper, we propose a novel fully convolutional network (FCN) with Sinc and dilated convolutional layers (termed SDFCN) for multichannel SE that operates in the time domain. We also propose an extended version of SDFCN, called the residual SDFCN (termed rSDFCN). The proposed methods are evaluated on two multichannel SE tasks, namely the dual-channel inner-ear microphones SE task and the distributed microphones SE task. The experimental results confirm the outstanding denoising capability of the proposed SE systems on both tasks and the benefits of using the residual architecture on the overall SE performance.

연구 동기 및 목표

  • 스펙트럼 매핑 기반 음성 강화의 한계, 특히 위상 추정 오류를 해결하기 위해 시간 도메인 파형 매핑 기반 접근법을 개발한다.
  • 단일채널에서 다중채널 환경으로 파형 매핑 기술을 확장하여 복잡한 음향 환경에서의 강력한 음성 강화를 가능하게 한다.
  • 효율적이고 효과적인 다중채널 음성 강화를 위한 Sinc 및 확장 컨볼루션을 갖춘 완전 컨볼루션 신경망 아키텍처를 설계한다.
  • 내이 마이크로폰 및 분산 마이크로폰 설정과 같은 두 가지 다릅한 다중채널 음성 강화 과제에 대해 제안된 방법을 평가한다.
  • 잔차 연결이 파형 매핑 모델의 성능과 안정성에 미치는 영향을 조사한다.

제안 방법

  • 제안된 SDFCN은 원시 파형에서 직접 최적의 필터 베이스를 학습하기 위해 Sinc 컨볼루션 레이어를 사용하며, 파rameter 효율적인 스펙트럼 모델링을 가능하게 한다.
  • 모델의 복잡도를 증가시키지 않고 수용영역을 확장하기 위해 확장 컨볼루션을 통합하여 장기적인 시간적 의존성을 포착할 수 있다.
  • 잔차 SDFCN(rSDFCN)은 그래디언트 흐름과 학습 안정성을 향상시키기 위해 스킵 연결을 통합하여 깊은 아키텍처에서의 특징 학습을 강화한다.
  • 모델은 스펙트럼 도메인 방법에서 발생하는 위상 추정 오류를 피하기 위해 다중채널 입력 파형을 직접 시간 도메인에서 처리한다.
  • 다중 헤드 어텐션 메커니즘은 사용되지 않으며, 대신 확장 및 Sinc 컨볼루션의 계층적 특징 학습을 통해 강력한 강화 성능을 달성한다.
  • 강화된 파형과 청소된 파형 간의 평균 제곱오차 손실을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1Sinc 및 확장 컨볼루션을 갖춘 완전 컨볼루션 신경망이 시간 도메인에서 다중채널 음성 강화에 효과적으로 기여할 수 있는가?
  • RQ2제안된 SDFCN 아키텍처는 기존의 파형 매핑 모델 대비 다중채널 데이터에서 노이즈 제거 성능 측면에서 어떻게 비교되는가?
  • RQ3잔차 연결은 다중채널 환경에서 파형 매핑 모델의 성능과 수렴성에 어떤 영향을 미치는가?
  • RQ4내이 마이크로폰 및 분산 마이크로폰 과제에서 제안된 방법이 기존의 스펙트럼 매핑 기반 시스템보다 음성 품질과 이해 가능성 측면에서 뛰어나게 성능을 발휘하는가?
  • RQ5Sinc 및 확장 컨볼루션 설계는 정확도를 유지하거나 향상시키면서도 파rameter 수를 줄일 수 있는가?

주요 결과

  • 제안된 SDFCN은 이중채널 내이 마이크로폰 및 분산 마이크로폰 과제에서 모두 음성 품질 향상과 노이즈 감소에 뚜렷한 개선을 이룬다.
  • rSDFCN 버전은 기본 SDFCN을 초월하여 잔차 연결이 모델의 안정성과 성능을 향상시킨다는 점을 입증한다.
  • 특히 음성 이해 가능성 유지와 잡음 아티팩트 감소 측면에서 최신 기술 대비 경쟁적인 성능을 달성한다.
  • Sinc 컨볼루션의 사용은 네트워크가 원시 파형에서 최적의 필터 응답을 직접 학습함으로써 모델링 효율성을 향상시킨다.
  • 확장 컨볼루션 레이어는 모델 복잡도를 증가시키지 않고도 장기적인 시간적 의존성을 효과적으로 포착한다.
  • 원시 파형에 대한 엔드 투 엔드 훈련은 파형 복원 오차를 줄이기 위해 위상 복원이 필요 없게 하여 강화된 출력의 왜곡을 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.