Skip to main content
QUICK REVIEW

[논문 리뷰] Speaker-Conditional Chain Model for Speech Separation and Extraction

Jing Shi, Jiaming Xu|arXiv (Cornell University)|2020. 06. 25.
Speech and Audio Processing참고 문헌 35인용 수 4
한 줄 요약

이 논문은 변수 수의 화자 수를 가진 완전히 겹쳐진 장시간 음성 기록에서 화자 정체성과 음성 소스를 동시에 추론하는 화자 조건부 체인 모델(Speaker-Conditional Chain Model, SCCM)을 제안한다. 순서 기반 화자 정체성 추론 모듈을 사용한 후에 화자 조건부 음성 추출을 수행함으로써, SCCM은 다회차 대화 상황에서도 안정적인 성능을 보이며, 장시간이고 겹쳐진 기록에서 기준 모델 대비 SI-SNRi 및 WER 지표에서 뛰어난 성능을 달성한다.

ABSTRACT

Speech separation has been extensively explored to tackle the cocktail party problem. However, these studies are still far from having enough generalization capabilities for real scenarios. In this work, we raise a common strategy named Speaker-Conditional Chain Model to process complex speech recordings. In the proposed method, our model first infers the identities of variable numbers of speakers from the observation based on a sequence-to-sequence model. Then, it takes the information from the inferred speakers as conditions to extract their speech sources. With the predicted speaker information from whole observation, our model is helpful to solve the problem of conventional speech separation and speaker extraction for multi-round long recordings. The experiments from standard fully-overlapped speech separation benchmarks show comparable results with prior studies, while our proposed model gets better adaptability for multi-round long recordings.

연구 동기 및 목표

  • 고정된 화자 수를 가정하고 장시간 다회차 기록에서 어려움을 겪는 기존 음성 분리 모델의 한계를 해결하기 위해.
  • 사전에 화자 수를 알지 못한 채 완전히 겹쳐진 장시간 음성 기록에서 화자 정체성과 개별 음성 소스를 동시에 추론할 수 있도록 하기 위해.
  • 희박한 겹침 비율(예: 약 15%)과 세그먼트 간 동적 화자 역할 변화가 있는 실세계 환경에서 일반화 능력과 안정성을 향상시키기 위해.
  • 청결한 음성 소스와 화자 정체성 레이블을 동시에 제공함으로써 음성 인식 등의 후행 작업을 지원하는 통합 프레임워크를 제공하기 위해.
  • 장시간 기록에서 세그먼트 간 화자 순서 일관성이 유지되지 않는 기존 모델의 한계를 극복하기 위해.

제안 방법

  • 모델은 전체 스펙트로그램 입력에서 화자 정체성을 추론하기 위해 순서 기반 아키텍처를 사용하여 화자 임베딩의 시퀀스를 생성한다.
  • 추론된 화자 정체성은 음성 추출 모듈의 조건부 입력으로 사용되어 개별 음성 소스를 생성한다.
  • 모델은 조건부 확률의 연쇄 법칙을 사용해 엔드 투 엔드로 훈련된다: P(소스 | 혼합) = P(화자 | 혼합) × P(소스 | 혼합, 화자).
  • 화자 정체성 추론 모듈은 전체 기록을 처리하지만, 메모리 오버플로우를 방지하기 위해 추출 모듈은 4초 랜덤 세그먼트에서 작동한다.
  • 모델는 실제 대화의 역동성을 시뮬레이션하기 위해 서로 다른 화자로부터의 발화를 무작위 시간 이동을 통해 연결하여 생성한 합성 다회차 기록으로 훈련된다.
  • 고정된 화자 임베딩에 의존하지 않고 화자 관련 숨겨진 표현을 학습함으로써, 모델은 오픈 보이스 화자 작업을 지원한다.
Figure 1: The framework of the proposed Speaker-Conditional Chain Model (SCCM). (a) shows the whole strategy of our proposed SCCM; (b) is the module of speaker inference , which predicts the speaker identities and corresponding embeddings. (c) refers to the time-domain speech extraction module. This
Figure 1: The framework of the proposed Speaker-Conditional Chain Model (SCCM). (a) shows the whole strategy of our proposed SCCM; (b) is the module of speaker inference , which predicts the speaker identities and corresponding embeddings. (c) refers to the time-domain speech extraction module. This

실험 결과

연구 질문

  • RQ1변수 수의 화자 수를 가진 장시간 완전히 겹쳐진 기록에서 통합 모델이 화자 정체성과 음성 소스를 동시에 추론할 수 있는가?
  • RQ2제안된 화자 조건부 체인 모델은 다회차 대화가 포함된 장시간 기록에서 기준 분리 모델 대비 어떻게 성능을 내는가?
  • RQ3화자 역할이 시간이 지남에 따라 변화할 때, 모델은 세그먼트 간 일관된 화자 순서와 성능을 유지하는가?
  • RQ4모델은 낮은 겹침 비율(~15%)과 자연스러운 화자 턴 간섭이 있는 실세계 환경에 얼마나 잘 일반화되는가?
  • RQ5모델이 생성한 화자 정체성 정보는 자동 음성 인식과 같은 후행 작업에서 효과적으로 활용될 수 있는가?

주요 결과

  • SCCM은 다회차 기록에서 테스트 SI-SNRi가 13.7을 기록하여 기준 TasNet 모델(11.5)을 능가함으로써 장시간 환경에서 더 뛰어난 안정성과 성능을 입증했다.
  • 동일한 다회차 벤치마크에서 SCCM은 40% 겹침 조건에서 기준 모델 대비 평균 10.2%의 WER 감소를 기록하여 겹침 증가에 대한 강건성을 입증했다.
  • 비겹침 세그먼트(0S)에서는 12.6%의 WER, 고겹침 세그먼트(40%)에서는 26.8%의 WER를 유지함으로써 다양한 겹침 조건에서 일관된 성능을 보였다.
  • 화자 정체성 추론 모듈은 시간에 따른 화자 활동 패턴을 성공적으로 포착했으며, 어텐션 시각화 결과에서 실제 화자 턴과의 정렬을 보였다.
  • 기존 모델이 세그먼트 간 화자 순서 일관성 문제를 애로로 겪는 데 비해, SCCM은 장시간 기록에서 더 뛰어난 적응 능력을 보였다.
  • 화자 정체성 정보를 조건부 입력으로 포함함으로써 후행 음성 인식 성능이 향상되었으며, 특히 고겹침 상황에서 두드러진 효과를 보였다.
Figure 2: Visualization of one sample of the learned attention status in speaker inference module for overlapped speech in WSJ0-2mix.
Figure 2: Visualization of one sample of the learned attention status in speaker inference module for overlapped speech in WSJ0-2mix.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.