Skip to main content
QUICK REVIEW

[논문 리뷰] Discretization and Re-synthesis: an alternative method to solve the Cocktail Party Problem

Jing Shi, Xuankai Chang|arXiv (Cornell University)|2021. 12. 17.
Speech and Audio Processing인용 수 11
한 줄 요약

이 논문은 전통적인 회귀 기반 접근 방식을 대체하여 이산 기호 시퀀스를 사용하는 분류 기반 프레임워크를 활용하는 새로운 음성 분리 방법을 제안한다. VQ-VAE 또는 HuBERT를 활용해 이산화하고 HiFi-GAN을 통해 재합성함으로써 고품질, 저간섭류 음성 분리를 달성하며, 원활한 스피커 컨버전을 가능하게 하여 주관적 품질과 간섭 감소 측면에서 회귀 기반 모델을 능가한다.

ABSTRACT

Deep learning based models have significantly improved the performance of speech separation with input mixtures like the cocktail party. Prominent methods (e.g., frequency-domain and time-domain speech separation) usually build regression models to predict the ground-truth speech from the mixture, using the masking-based design and the signal-level loss criterion (e.g., MSE or SI-SNR). This study demonstrates, for the first time, that the synthesis-based approach can also perform well on this problem, with great flexibility and strong potential. Specifically, we propose a novel speech separation/enhancement model based on the recognition of discrete symbols, and convert the paradigm of the speech separation/enhancement related tasks from regression to classification. By utilizing the synthesis model with the input of discrete symbols, after the prediction of discrete symbol sequence, each target speech could be re-synthesized. Evaluation results based on the WSJ0-2mix and VCTK-noisy corpora in various settings show that our proposed method can steadily synthesize the separated speech with high speech quality and without any interference, which is difficult to avoid in regression-based methods. In addition, with negligible loss of listening quality, the speaker conversion of enhanced/separated speech could be easily realized through our method.

연구 동기 및 목표

  • 유사한 스피커와 비정적 노이즈를 다룰 때 회귀 기반 음성 분리 모델의 한계를 해결하기 위해.
  • 신호 수준의 회귀에서 이산 기호를 사용하는 시퀀스 분류로 전환함으로써 음성 분리의 대안적 패러다임을 탐색하기 위해.
  • 예측된 이산 표현에서 재합성함으로써 쿠키티 파티 문제 상황에서 음성 품질을 향상시키고 간섭을 줄이기 위해.
  • 최소한의 품질 저하로 분리된 음성에서의 유연한 스피커 컨버전을 가능하게 하기 위해.

제안 방법

  • 목표 음성을 이산 기호 시퀀스로 분해하기 위해 VQ-VAE 또는 HuBERT 모델을 사용한다.
  • 혼합 입력에서 각 스피커의 이산 기호 시퀀스를 분류 기반 모델이 예측한다.
  • 예측된 이산 시퀀스를 HiFi-GAN 보코더를 사용하여 웨이브폼으로 재합성한다.
  • 다른 스피커 임베딩을 사용해 이산 기호 시퀀스를 이동시킴으로써 스피커 컨버전을 지원한다.
  • 시스템은 두 단계로 운영된다: 이산 기호 예측 → 웨이브폼 재합성.
  • 연속 웨이브폼에 대한 직접 회귀를 피함으로써 마스킹 기반 방법에서 흔히 발생하는 간섭 아티팩트를 줄인다.

실험 결과

연구 질문

  • RQ1이산 기호를 사용하는 분류 기반 접근 방식이 음성 분리 품질과 간섭 감소 측면에서 회귀 기반 모델을 능가할 수 있는가?
  • RQ2유사한 스피커와 비정적 노이즈 상황에서 제안된 방법의 성능은 어떠한가?
  • RQ3이산 재합성 프레임워크 내에서 음성 품질 저하 없이 스피커 컨버전을 얼마나 잘 달성할 수 있는가?
  • RQ4왜 목적 평가 지표(예: PESQ, SI-SNR)는 재합성 출력의 높은 주관적 품질을 반영하지 못하는가?

주요 결과

  • 제안된 방법은 VCTK-noisy 코퍼스에서 주관적 평균 의견 점수(sMOS) 4.02 ± 0.14를 기록하여 청취 품질 측면에서 청소화 기준값(4.03 ± 0.13)과 거의 동일한 결과를 보였다.
  • 기준 모델 대비 겹쳐진 음성 비율을 거의 한 계단 낮추어 훨씬 청결한 분리 성능을 입증했다.
  • WSJ0-2mix 코퍼스에서 성별 조합 간 일관된 성능을 보였으며, 동성 쌍의 경우 기준 모델과 달리 품질 저하가 없었다.
  • 재학습 후 합성 음성에 대한 음성 인식 WER은 22.4%에서 13.0%로 향상되어 원본 노이즈 입력(19.5%)을 초월했으며, 높은 명료성과 함께 우수한 성능을 보였다.
  • VCTK-noisy 코퍼스에서 노이즈 MOS는 4.02로 거의 완벽한 수준이었으며, 청소화 기준과 유사하여 청각적 품질 저하가 거의 없음을 시사했다.
  • 낮은 목적 점수(예: PESQ 1.26)에도 불구하고 뛰어난 주관적 품질을 제공하여 목적 지표와 인간 인식 간 괴리가 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.