Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-talker Speech Separation and Tracing with Permutation Invariant Training of Deep Recurrent Neural Networks.

Morten Kolbæk, Dong Yu|arXiv (Cornell University)|2017. 03. 18.
Speech and Audio Processing참고 문헌 27인용 수 13
한 줄 요약

이 논문은 RNN을 사용하는 엔드 투 엔드 딥 러닝 방법인 발화 수준의 순열 불변 트레이닝(uPIT)을 소개한다. 이 방법은 추론 시 순열 정렬이 필요 없도록 발화 수준의 분리 오차를 최소화한다. uPIT는 사전에 화자 수, 정체성, 성별에 대한 지식이 없어도 화자 독립적인 다화자 음성 분리가 가능하며, NMF, CASA를 능가하고 DPCL 및 DANet과 유사한 성능을 내며, 예상치 못한 화자와 언어로의 일반화 능력을 보인다.

ABSTRACT

In this paper we propose the utterance-level Permutation Invariant Training (uPIT) technique. uPIT is a practically applicable, end-to-end, deep learning based solution for speaker independent multi-talker speech separation. Specifically, uPIT extends the recently proposed Permutation Invariant Training (PIT) technique with an utterance-level cost function, hence eliminating the need for solving an additional permutation problem during inference, which is otherwise required by frame-level PIT. We achieve this using Recurrent Neural Networks (RNNs) that, during training, minimize the utterance-level separation error, hence forcing separated frames belonging to the same speaker to be aligned to the same output stream. In practice, this allows RNNs, trained with uPIT, to separate multi-talker mixed speech without any prior knowledge of signal duration, number of speakers, speaker identity or gender. We evaluated uPIT on the WSJ0 and Danish two- and three-talker mixed-speech separation tasks and found that uPIT outperforms techniques based on Non-negative Matrix Factorization (NMF) and Computational Auditory Scene Analysis (CASA), and compares favorably with Deep Clustering (DPCL) and the Deep Attractor Network (DANet). Furthermore, we found that models trained with uPIT generalize well to unseen speakers and languages. Finally, we found that a single model, trained with uPIT, can handle both two-speaker, and three-speaker speech mixtures.

연구 동기 및 목표

  • 화자 수, 정체성, 성별에 대한 사전 지식이 없이 화자 독립적인 다화자 음성 분리를 해결하는 것.
  • 프레임 수준의 순열 불변 트레이닝(PIT)에서 요구되는 추론 시 순열 문제를 해결할 필요 없이 제거하는 것.
  • 재학습 없이도 두 명과 세 명의 화자 혼합을 모두 처리할 수 있는 통합 모델을 개발하는 것.
  • 기존 방법에 비해 예상치 못한 화자와 언어로의 일반화 능력을 향상시키는 것.

제안 방법

  • uPIT는 발화 수준의 비용 함수를 도입하여, 각 프레임이 아니라 전체 발화에 걸쳐 총 분리 오차를 최소화함으로써, 프레임 수준의 PIT를 발전시킨다.
  • 순환 신경망(RNNs)은 발화 수준 오차를 최소화함으로써, 같은 화자에서 온 프레임을 동일한 출력 스트림에 할당하도록 훈련된다.
  • 발화 수준의 목표 함수를 통해 훈련 중에 화자별 스트림 정렬을 학습함으로써 추론 시 순열 문제를 피한다.
  • 모델은 화자 정체성 레이블 없이 혼합 음성 데이터에서 엔드 투 엔드로 훈련되며, 일관된 화자 분리를 보장하기 위해 발화 수준의 손실에 의존한다.
  • RNN을 사용하여 음성의 순차적 의존성을 모델링하고, WSJ0 및 덴마크어 데이터셋에서 두 명과 세 명의 화자 혼합에 대해 적용하였다.
  • 훈련 목표는 순열 모호성과 관계없이 같은 화자에서 온 프레임이 항상 동일한 출력 스트림에 할당되도록 보장한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 딥 러닝 모델이 추론 시 순열 문제를 해결할 필요 없이 화자 독립적인 다화자 음성 분리를 달성할 수 있는가?
  • RQ2발화 수준의 손실을 사용한 훈련이, 프레임 수준의 PIT에 비해 예상치 못한 화자와 언어로의 일반화 능력을 향상시키는가?
  • RQ3재학습 없이도 하나의 uPIT 모델이 두 명과 세 명의 화자 혼합을 효과적으로 분리할 수 있는가?
  • RQ4uPIT는 표준 다화자 분리 벤치마크에서 NMF, CASA, DPCL, DANet과 비교해 성능가능한가?

주요 결과

  • uPIT는 WSJ0 및 덴마크어 데이터셋에서 비음성 행렬 분해(NMF)와 계산 청각 시나리오 분석(CASA)를 모두 능가한다.
  • uPIT는 동일한 벤치마크에서 깊이 클러스터링(DPCL) 및 딥 어트랙터 네트워크(DANet)와 유사한 성능을 달성한다.
  • uPIT로 훈련된 모델은 예상치 못한 화자와 언어로의 일반화에 매우 잘 성능을 보이며, 훈련 분포를 초월한 강건성을 입증한다.
  • 두 명과 세 명의 화자 혼합 데이터에서 훈련된 단일 uPIT 모델은 재학습 없이도 둘 다 성공적으로 처리할 수 있으며, 아키텍처 변경 없이도 가능하다.
  • 발화 수준의 훈련 목표 함수는 추론 시 순열 모호성을 효과적으로 해결하여, 후처리 순열 매칭이 필요 없도록 한다.
  • 모델는 훈련 시 화자 정체성 또는 성별 정보가 필요 없이도 엔드 투 엔드 접근법 중 최고 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.