Skip to main content
QUICK REVIEW

[논문 리뷰] USTC-NELSLIP System Description for DIHARD-III Challenge

Yuxuan Wang, Maokui He|arXiv (Cornell University)|2021. 03. 19.
Speech Recognition and Synthesis참고 문헌 21인용 수 20
한 줄 요약

이 논문은 DIHARD-III 음성 다이어라이제이션 챌린지에 대비해 USTC-NELSLIP 시스템을 제시하며, 소음이 많고 다수의 말하는 이가 있는 환경에서의 다이어라이제이션 성능 향상을 위해 반복적 음성 분리(iss)와 반복적 타겟 말하는 이 VAD(its-vad)를 도입한다. 도메인에 의존하는 처리, 오디오 도메인 분류 및 모델 융합을 통합함으로써, 트랙 1에서는 11.30%의 DER을 기록했고 트랙 2에서는 16.78%를 기록하여 베이스라인 클러스터링 시스템 대비 48.7%의 상대적 향상을 이룩하며 랭킹 1위를 달성했다.

ABSTRACT

This system description describes our submission system to the Third DIHARD Speech Diarization Challenge. Besides the traditional clustering based system, the innovation of our system lies in the combination of various front-end techniques to solve the diarization problem, including speech separation and target-speaker based voice activity detection (TS-VAD), combined with iterative data purification. We also adopted audio domain classification to design domain-dependent processing. Finally, we performed post processing to do system fusion and selection. Our best system achieved DERs of 11.30% in track 1 and 16.78% in track 2 on evaluation set, respectively.

연구 동기 및 목표

  • 겹침 음성과 배경 소음이 있는 과도한 실생활 환경에서 음성 다이어라이제이션 성능을 향상시키기 위해.
  • 도메인 특화된 변동성을 도메인 분류 및 맞춤형 처리 파이프라인을 통해 다루기 위해.
  • 반복적 음성 분리(iss)와 반복적 타겟 말하는 이 VAD(its-vad) 시스템을 통합함으로써 다이어라이제이션 정확도를 향상시키기 위해.
  • 다중 시스템 융합 및 반복적 데이터 정제를 통해 다이어라이제이션 오류율(der)을 감소시키기 위해.
  • 종단 간 및 하이브리드 모듈러 접근 방식을 사용하여 DIHARD-III 챌린지에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 10초 세그먼트에서 훈련된 17층의 ResNet 기반 오디오 도메인 분류기가 11개의 서로 다른 오디오 도메인을 식별하는 데 성공하여 개발 세트에서 100%의 정확도를 달성했다.
  • RESTAURANT 도메인에 대해 점진적 다중 타겟 음성 향상 기법을 적용하였으며, 각 층에서 신호 대 잡음비가 10 dB 증가하도록 설정하였고, 향상에 PELPS 및 PRM 특징을 사용하였다.
  • 250시간의 시뮬레이션된 2명의 말하는 이가 있는 Librispeech 데이터를 기반으로 반복적 음성 분리(iss) 시스템을 훈련시켜 겹침 음성에서의 말하는 이 분리 성능을 향상시켰다.
  • 확장된 VoxCeleb 데이터에서 i-vector 추출을 수행한 후, 2500시간의 현실적이고 시뮬레이션된 다중 말하는 이 데이터를 기반으로 반복적 타겟 말하는 이 VAD(its-vad) 시스템을 훈련시켰다.
  • 다양한 SAD 모델(DNN, CLDNN, TDNN)을 훈련시킨 후 가중치 투표를 통해 융합하여 음성 활동 검출 정확도를 향상시켰다.
  • 다양한 반복 횟수의 iss 및 its-vad 출력을 기반으로 dover-lap를 사용해 시스템 융합을 수행하였으며, 최종 결과는 후처리 및 도메인 특화 라우팅을 통해 선택되었다.

실험 결과

연구 질문

  • RQ1반복적 음성 분리 기법이 겹침이 많고 소음이 많은 음성 환경에서 다이어라이제이션 성능을 크게 향상시킬 수 있는가?
  • RQ2다양한 오디오 도메인에서 전통적인 클러스터링 기반 다이어라이제이션과 비교해 볼 때, 반복적 타겟 말하는 이 VAD는 어떻게 성능을 내는가?
  • RQ3도메인에 의존하는 처리가 이질적인 실생활 녹음 자료 전반에서 다이어라이제이션의 강건성을 얼마나 향상시키는가?
  • RQ4음성 향상, SAD 융합, 반복적 정제를 조합했을 때 전체 다이어라이제이션 오류율에 어떤 영향을 미치는가?
  • RQ5다양한 반복적 다이어라이제이션 시스템을 융합할 때 dover-lap를 통한 모델 융합이 DER을 추가로 감소시킬 수 있는가?

주요 결과

  • USTC-NELSLIP 시스템은 트랙 1 평가 세트에서 11.30%의 다이어라이제이션 오류율(der)을 기록하였으며, 이는 베이스라인 클러스터링 시스템 대비 48.7%의 상대적 향상이다.
  • 트랙 2에서는 DER이 16.78%를 기록하였고, 전체 평가 세트에서 DER이 25.36%였던 베이스라인 시스템을 크게 앞서며 성능을 냈다.
  • iss 기반 시스템을 통합함으로써 반복 훈련과 dover-lap 융합을 거친 후 DER이 16.22%에서 8.31%로 감소하여 강력한 반복 정제 효과를 입증했다.
  • 세 개의 SAD 모델(DNN, CLDNN, TDNN)을 융합함으로써 전체 SAD 오류율이 베이스라인의 2.42%에서 개발 세트 전체에서 1.36%로 감소하여 효과적인 상호 보완성이 입증되었다.
  • ITS-VAD 시스템은 RESTAURANT 도메인을 제외한 모든 도메인에서 베이스라인 클러스터링 시스템을 능가했으며, 고소음과 겹침으로 인해 성능 저하가 발생한 RESTAURANT 도메인의 경우 도메인 특화 라우팅의 타당성을 입증했다.
  • 오디오 도메인 분류가 개발 세트에서 100%의 정확도를 달성하여 효과적인 도메인 인식 처리 및 오디오 스트림의 라우팅을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.