[논문 리뷰] Royalflush Speaker Diarization System for ICASSP 2022 Multi-channel Multi-party Meeting Transcription Challenge
이 논문은 ICASSP 2022 M2MeT 챌린지에 대비해 Royalflush 스피커 다이어라이제이션 시스템을 제시하며, 다중 채널 U-Net 기반의 겹침 음성 탐지 모델, 음성 분離 및 확인 기반의 겹침 음성 처리 방법, 그리고 세 가지 스피커 임베딩 아키텍처를 도입한다. 이 시스템은 원거리 음성 환경에서의 Alimeeting 평가 세트에서 6.30%의 다이어라이제이션 오류율(DER)을 기록하였으며, 베이스라인의 15.25%에서 크게 감소하여 최고 개별 시스템에서는 6.40%까지 저감되었고, 앙상블 융합을 통해 더욱 향상되었다.
This paper describes the Royalflush speaker diarization system submitted to the Multi-channel Multi-party Meeting Transcription Challenge(M2MeT). Our system comprises speech enhancement, overlapped speech detection, speaker embedding extraction, speaker clustering, speech separation and system fusion. In this system, we made three contributions. First, we propose an architecture of combining the multi-channel and U-Net-based models, aiming at utilizing the benefits of these two individual architectures, for far-field overlapped speech detection. Second, in order to use overlapped speech detection model to help speaker diarization, a speech separation based overlapped speech handling approach, in which the speaker verification technique is further applied, is proposed. Third, we explore three speaker embedding methods, and obtained the state-of-the-art performance on the CNCeleb-E test set. With these proposals, our best individual system significantly reduces DER from 15.25% to 6.40%, and the fusion of four systems finally achieves a DER of 6.30% on the far-field Alimeeting evaluation set.
연구 동기 및 목표
- 겹침 음성, 소음, 반향 등 도전적인 원거리 다중 스피커 미팅 환경에서의 스피커 다이어라이제이션 성능 향상.
- 다중 채널 음성과 U-Net 아키텍처를 활용해 악성 음향 조건에서도 향상된 탐지 성능을 보이는 원거리 겹침 음성 탐지(OSD) 모델 개발.
- 음성 분리와 스피커 확인을 융합하여 겹침 음성 구간의 레이블링 정확도 향상.
- CNCeleb-E 테스트 세트에서 최적의 성능을 내기 위해 최신 스피커 임베딩 모델들을 평가하고 비교.
- 다양한 아키텍처와 처리 전략을 가진 다수의 하위 시스템을 융합하여 M2MeT 챌린지에서 최고 성능 달성.
제안 방법
- 원거리 겹침 음성 탐지를 위한 다중 채널 U-Net 기반 아키텍처를 제안하며, 8채널 마이크 배열의 공간 다양성과 U-Net의 U자형 인코더-디코더 아키텍처를 결합해 프레임 단위 분할 정확도 향상.
- 다중 채널 WPE를 통해 음성 향상 후 DAS beamforming을 적용해 단일 채널 청소된 신호를 생성하여 후속 처리에 활용하며, 원시 다중 채널 입력을 사용하는 OSD 모듈은 이를 제외.
- 겹침 음성 구간 처리를 위해 두 가지 방법을 적용: 히우리스틱 방법으로 가장 가까운 두 스피커 레이블 할당, 음성 분리 기반 방법으로 Conv-Tasnet을 사용해 혼합 신호 분리 후 스피커 임베딩 중심점과 코사인 유사도를 활용한 스피커 확인 수행.
- CNCeleb 데이터셋에서 세 가지 다른 스피커 임베딩 모델을 학습 및 평가하며, MUSAN과 RIRs를 활용한 데이터 증강 및 sox를 통한 템포 변형 적용.
- DOVER-Lap 툴킷을 사용해 네 개의 서로 다른 하위 시스템(스피커 임베딩 모델 및 겹침 음성 처리 전략이 상이함)의 출력을 융합.
- 최종 시스템은 원거리 Alimeeting 데이터셋에서 학습 및 평가되며, 음성 분리 데이터는 서로 다른 스피커의 두 임의의 발화를 -5 dB에서 5 dB 사이의 신호 대 잡음비(SNR)로 혼합하여 시뮬레이션.
실험 결과
연구 질문
- RQ1다중 채널 U-Net 기반 아키텍처가 원거리 다중 스피커 미팅 환경에서의 겹침 음성 탐지에서 기존 모델보다 우월한 성능을 내는가?
- RQ2히우리스틱 레이블링 대비 음성 분리와 스피커 확인을 융합한 방법이 겹침 음성 영역에서 다이어라이제이션 정확도 향상에 기여하는가?
- RQ3CNCeleb-E 평가 세트에서 가장 우수한 성능을 내는 스피커 임베딩 모델 아키텍처는 무엇인가?
- RQ4다양한 구성 요소를 가진 다수의 하위 시스템을 융합함으로써 전체 다이어라이제이션 오류율(DER)을 얼마나 줄일 수 있는가?
- RQ5원거리 Alimeeting 평가 세트에서 제안된 시스템은 베이스라인 시스템 대비 DER 측면에서 어떻게 비교되는가?
주요 결과
- 최고 개별 시스템은 원거리 Alimeeting 평가 세트에서 다이어라이제이션 오류율(DER)을 베이스라인의 15.25%에서 6.40%로 감소시켰다.
- DOVER-Lap를 사용해 네 개의 하위 시스템을 융합한 결과, 동일 평가 세트에서 최종 DER은 6.30%를 기록하여 앙상블 학습의 효과를 입증했다.
- 음성 분리 기반의 겹침 음성 처리 방법은 히우리스틱 방법 대비 약 1%p의 절대적 DER 감소를 이룩했다.
- 제안된 다중 채널 U-Net 기반 OSD 모델은 다중 채널 입력에서 유도된 공간적 및 스펙트럼적 특징을 활용해 원거리 조건에서의 탐지 성능 향상을 달성했다.
- 평가된 세 가지 스피커 임베딩 모델 중 가장 견고한 아키텍처가 CNCeleb-E 테스트 세트에서 최신 기술 수준의 성능을 달성했다.
- WPE 및 DAS beamforming을 통한 음성 향상은 스피커 클러스터링 및 음성 분리 성능 향상에 기여했지만, OSD에는 악영향을 미쳐 OSD 파이프라인에서 제외되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.