[논문 리뷰] Continuous Speech Separation Using Speaker Inventory for Long Multi-talker Recording
이 논문은 클러스터링 기반의 화자 임베딩 추출을 통해 장기 다화자 녹음에서 직접 화자 인벤토리(화자 목록)를 구성함으로써 외부 등록 데이터가 필요 없이 연속적 음성 분離(Continuous Speech Separation)을 수행하는 CSSUSI(CSSUSI)를 제안한다. 이 방법은 장기적이고 현실적인, 노이즈가 많고 반사가 강한 녹음에서 기준 모델보다 뚜렷한 성능 향상을 이룬다. 특히 외부 화자 프로파일이 있는 시스템조차도 열등하다.
Leveraging additional speaker information to facilitate speech separation has received increasing attention in recent years. Recent research includes extracting target speech by using the target speaker's voice snippet and jointly separating all participating speakers by using a pool of additional speaker signals, which is known as speech separation using speaker inventory (SSUSI). However, all these systems ideally assume that the pre-enrolled speaker signals are available and are only evaluated on simple data configurations. In realistic multi-talker conversations, the speech signal contains a large proportion of non-overlapped regions, where we can derive robust speaker embedding of individual talkers. In this work, we adopt the SSUSI model in long recordings and propose a self-informed, clustering-based inventory forming scheme for long recording, where the speaker inventory is fully built from the input signal without the need for external speaker signals. Experiment results on simulated noisy reverberant long recording datasets show that the proposed method can significantly improve the separation performance across various conditions.
연구 동기 및 목표
- 기존 음성 분리 시스템에서 장기적이고 현실적인 녹음에 대해 사전에 화자 신호를 등록하는 것이 비현실적이라는 점을 해결하기 위해.
- 낮은 총 겹침 비율과 희박한 화자 활동을 보이는 장기 녹음에서 연속적 음성 분리(CSS) 성능을 향상시키기 위해.
- 입력 혼합 신호에서 직접 화자 인벤토리를 구성하는 자가 정보 기반의 클러스터링 기반 방법을 개발하기 위해.
- 장기 녹음에서 겹치지 않는 영역에서 유도된 화자 정보가 분리 성능을 크게 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 장기 녹음의 겹치지 않는 세그먼트에서 사전에 훈련된 화자 임베딩 모델을 사용해 화자 임베딩을 추출한다.
- 추출된 임베딩에 대해 과다 클러스터링(over-clustering)을 적용하여, 예상되는 화자 수를 초과하는 클러스터 수를 갖는 자가 정보 기반 화자 인벤토리를 구성한다.
- 혼합 신호 임베딩과의 유사도를 기반으로 인벤토리에서 관련 있는 화자 프로파일을 동적으로 선택하는 프로파일 선택 모듈을 사용한다.
- 선택된 프로파일을 편향된 음성 분리 모듈에 입력하며, 이 모듈은 순열 불변 훈련(PIT)을 사용하여 강인성을 높이고 약하거나 잘못된 프로파일 매칭을 처리한다.
- 각 화자에 대해 국소적 분리 출력을 연결하여 연속적이고 겹치지 않는 음성 스트림을 구성한다.
- 자연스러운 회의실 대화를 모의한 노이즈가 많고 반사가 강한 장기 녹음 데이터셋을 사용해 시스템을 훈련하고 평가한다.
실험 결과
연구 질문
- RQ1외부 등록 없이 장기 다화자 녹음에서 혼합 신호 자체로부터 화자 인벤토리를 효과적으로 구성할 수 있는가?
- RQ2사전에 등록된 화자 신호에 의존하는 시스템과 비교해 자가 정보 기반 인벤토리를 사용한 화자 분리 성능는 어떻게 되는가?
- RQ3과다 클러스터링이 장기 녹음에서 화자 프로파일 선택의 강인성과 정확도에 미치는 영향은 무엇인가?
- RQ4연속적이고 겹침 비율이 낮은 환경에서 겹치지 않는 영역에서 유도된 화자 임베딩이 분리 성능 향상에 얼마나 기여하는가?
- RQ5실제 조건에서 화자 수와 겹침 비율이 다양할 경우에도 제안된 방법이 높은 성능을 유지하는가?
주요 결과
- CSSUSI는 모든 구성에서 기준 BLSTM 모델을 크게 능가하며, 2명 화자 녹음에서는 13.1 dB, 5명 화자 녹음에서는 11.9 dB, 8명 화자 녹음에서는 11.7 dB의 SI-SDR 성능을 기록한다.
- 외부 등록 데이터가 없는 상태에서 SSUSI와 유사한 성능(13.2 dB, 12.0 dB, 11.7 dB)을 달성함으로써 외부 화자 데이터가 필요 없이도 뛰어난 성능을 확보한다.
- 다양한 클러스터 수에서 일관된 성능 유지를 보이며, 화자 수 이상의 클러스터 수를 사용할 경우 과다 클러스터링에 대해 강인함을 입증한다.
- 성능 향상의 주요 원인은 관련 있는 화자 프로파일의 효과적인 활용에 기인하며, 잘못된 두 개의 프로파일을 사용한 SSUSI도 기준 모델과 거의 동일한 성능을 보인다.
- 구문 단위 평가 결과, CSSUSI가 기준 모델을 크게 앞서며 장기 분리에서 강력한 일반화 능력과 연속성을 입증한다.
- 비겹치는 영역에서 유도된 전역 화자 정보를 효과적으로 활용해 국소 분리를 향상시키며, 노이즈가 많고 반사가 강한 환경에서도 효과적임을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.