[논문 리뷰] Microsoft Speaker Diarization System for the VoxCeleb Speaker Recognition Challenge 2020
이 논문은 볼즈SRC 2020 도전 대회에서 마이크로소프트가 최고로 랭크된 스피커 다이아라이제이션 시스템을 제시한다. 이 시스템은 컨فور머 기반 연속 음성 분리 모델과 Res2Net 기반 스피커 임베딩 추출기, 수정된 DOVER 융합 방법을 조합하여 개발되었으며, 개발 세트에서 3.71%의 DER, 평가 세트에서 6.23%의 DER를 기록하여, 동시에 발생하는 음성과 분리 모듈에서 발생하는 누출을 효과적으로 다루며 1등을 기록했다.
This paper describes the Microsoft speaker diarization system for monaural multi-talker recordings in the wild, evaluated at the diarization track of the VoxCeleb Speaker Recognition Challenge(VoxSRC) 2020. We will first explain our system design to address issues in handling real multi-talker recordings. We then present the details of the components, which include Res2Net-based speaker embedding extractor, conformer-based continuous speech separation with leakage filtering, and a modified DOVER (short for Diarization Output Voting Error Reduction) method for system fusion. We evaluate the systems with the data set provided by VoxSRCchallenge 2020, which contains real-life multi-talker audio collected from YouTube. Our best system achieves 3.71% and 6.23% of the diarization error rate (DER) on development set and evaluation set, respectively, being ranked the 1st at the diarization track of the challenge.
연구 동기 및 목표
- 실생활의 다중 대화자 녹음에서 동시에 발생하는 음성과 열악한 음향 조건이 존재하는 상황에서 스피커 다이아라이제이션 문제를 해결하기 위해.
- 엔드 투 엔드 음성 분리와 스피커 임베딩 및 클러스터링 파이프라인을 통합하여 다이아라이제이션 성능을 향상시키기 위해.
- 음성 분리 출력에서 잔류하는 노이즈와 음악 누출로 인한 잘못된 경고를 줄이기 위해.
- 중복 음성 처리가 가능한 새로운 투표 기반 융합 방법을 통해 시스템의 강건성과 정확도를 향상시키기 위해.
- 다양하고 실제 생활의 유튜브 녹음 영상이 포함된 볼즈SRC 2020 도전 대회 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 중복 음성을 두 개의 출력 채널으로 분리하여 동시에 발생하는 대화자를 더 잘 다룰 수 있도록, 컨포머 기반 연속 음성 분리(CSS) 시스템을 개발하였다.
- 더 나은 클러스터링 정확도를 위해 추가 마진 소프트맥스 손실을 사용한 Res2Net 기반 신경망을 사용하여 구분력 있는 스피커 임베딩을 추출하였다.
- 기본 시스템의 스피커 클러스터 중심점을 이용해 분리된 채널에서 잔류 노이즈와 음악을 제거함으로써 잘못된 경고를 억제하기 위해 누출 필터링 방법을 적용하였다.
- 다수의 다이아라이제이션 가설을 융합하기 위해 수정된 DOVER 알고리즘을 도입하였으며, 최고의 시스템을 루트 가설로 사용하고, 최고의 시스템에는 투표 가중치 1.0, 나머지 시스템에는 0.34를 설정하였다.
- 반복적인 가설 정렬과 가중 투표를 사용하였으며, 시간 영역은 총 투표 가중치가 1.0 이상일 경우에만 유지되었다.
- 개발 세트에서 그리드 서치를 통해 AHC 정지 임계값과 최소 스피커 지속 시간 등의 하이퍼파라미터를 최적화하였다.

실험 결과
연구 질문
- RQ1컨포머 기반 연속 음성 분리 모델은 중복 음성 상황에서 다이아라이제이션 성능 향상에 효과적으로 기여할 수 있는가?
- RQ2추가 마진 손실을 사용한 Res2Net 기반 스피커 임베딩 추출기의 통합은 스피커 클러스터링 정확도에 어떤 영향을 미치는가?
- RQ3누출 필터링은 분리된 채널에서 잔류 노이즈와 음악으로 인한 다이아라이제이션 출력의 잘못된 경고를 어느 정도 감소시키는가?
- RQ4중복 음성을 고려한 수정된 DOVER 융합 방법은 다중 시스템 다이아라이제이션에서 표준 융합 기법보다 우수한 성능을 낼 수 있는가?
- RQ5시스템 조합은 실제 생활의 제약 없는 녹음에서 다이아라이제이션 오류율(DER)과 재단 오류율(JER)에 어떤 영향을 미치는가?
주요 결과
- 최고의 단일 시스템(시스템 7)은 개발 세트에서 3.71%의 다이아라이제이션 오류율(DER)과 평가 세트에서 6.23%의 DER를 기록하여 볼즈SRC 2020 도전 대회에서 1등을 기록했다.
- 누출 필터링을 추가함으로써 DER가 크게 감소하여, 분리된 음성 출력에서 발생하는 잘못된 경고 억제에 효과적임을 입증하였다.
- 누출 필터링을 포함한 시스템 5는 개발 세트에서 23.97%의 JER을 기록하였고, 하이퍼파라미터 튜닝을 거친 시스템 6에서는 19.90%로 감소하여 분할 정확도 향상이 확인되었다.
- 시스템 8은 수정된 DOVER 방법을 사용해 네 개의 시스템을 융합하였으며, 루트 가설로 시스템 7을 사용하여 평가 세트에서 시스템 7보다 약간의 DER 향상을 달성했지만 JER는 약간 악화되었다.
- 수정된 DOVER 융합 방법은 중복 음성이 존재하는 상황에서도 시스템의 효과적인 조합을 가능하게 하였으며, 평가 세트에서 일관된 성능 향상으로 이를 입증하였다.
- 제한된 제출 기회(최대 4회)에도 불구하고, 시스템은 예측되지 않은 조건에 대해 강력한 일반화 능력을 보이며 평가 세트에서 최고 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.