Skip to main content
QUICK REVIEW

[논문 리뷰] KU-ISPL Speaker Recognition Systems under Language mismatch condition for NIST 2016 Speaker Recognition Evaluation

Suwon Shon, Hanseok Ko|arXiv (Cornell University)|2017. 02. 03.
Speech Recognition and Synthesis참고 문헌 5인용 수 4
한 줄 요약

이 논문은 NIST SRE 2016 평가를 위한 KU-ISPL의 화자 인식 시스템을 제시하며, 영어로 훈련된 모델과 비영어 테스트 세트(타갈로그어, 광둥어) 간의 언어 불일치 문제를 완화하는 데 초점을 맞춘다. 시스템은 고급 백엔드 기법을 포함한 네 가지 i-vector 추출 방법을 활용하며, 비지도 언어 클러스터링, 언어 간 변동성 보정, 성별/언어에 의존하는 스코어 정규화를 통해 도입하여 도전적인 다국어 조건에서도 경쟁 가능한 성능을 달성한다.

ABSTRACT

Korea University Intelligent Signal Processing Lab. (KU-ISPL) developed speaker recognition system for SRE16 fixed training condition. Data for evaluation trials are collected from outside North America, spoken in Tagalog and Cantonese while training data only is spoken English. Thus, main issue for SRE16 is compensating the discrepancy between different languages. As development dataset which is spoken in Cebuano and Mandarin, we could prepare the evaluation trials through preliminary experiments to compensate the language mismatched condition. Our team developed 4 different approaches to extract i-vectors and applied state-of-the-art techniques as backend. To compensate language mismatch, we investigated and endeavored unique method such as unsupervised language clustering, inter language variability compensation and gender/language dependent score normalization.

연구 동기 및 목표

  • 훈련 데이터는 영어이지만 테스트 데이터는 타갈로그어 및 광둥어인 화자 인식에서 언어 불일치 문제를 해결하기 위해.
  • 비지도 및 적응 기법을 활용해 다양한 언어 간의 시스템 강인성 향상.
  • 다국어 일반화에 특화된 여러 i-vector 추출 및 백엔드 처리 전략 개발 및 평가.
  • 언어 및 성별 차이에 특화된 효과적인 스코어 정규화 및 변동성 보정 방법 탐구.
  • 비모수적 테스트 언어를 가진 고정된 훈련 조건 하에서 NIST SRE 2016 평가에서 높은 성능 달성.

제안 방법

  • KU-ISPL 시스템 프레임워크를 활용해 네 가지의 차별화된 i-vector 추출 접근법을 개발하고 평가하였다.
  • 전사 없이 음성 세그먼트를 언어 정체성 기반으로 그룹화하기 위해 비지도 언어 클러스터링을 적용하였다.
  • 원천 언어와 대상 언어 간 분포 불일치를 줄이기 위해 언어 간 변동성 보정 기법을 도입하였다.
  • 다양한 인구통계학적 및 언어적 집단 간 스코어를 校정하기 위해 성별 및 언어에 의존하는 스코어 정규화를 적용하였다.
  • 결정 경계 분리 및 시스템 신뢰성 향상을 위해 최첨단 백엔드 기법을 통합하였다.
  • 목표로 하는 비영어 평가 언어를 시뮬레이션하고 최적화하기 위해 세부아노어 및 중국어 데이터에 대한 예비 실험을 실시하였다.

실험 결과

연구 질문

  • RQ1훈련 언어와 다른 언어로 테스트되는 경우 화자 인식 시스템이 어떻게 효과적으로 적응할 수 있는가?
  • RQ2비지도 언어 클러스터링은 다국어 i-vector 성능 향상에 어떤 역할을 하는가?
  • RQ3언어 간 변동성 보정은 언어 불일치 영향을 줄이는 데 얼마나 효과적인가?
  • RQ4성별 및 언어에 특화된 스코어 정규화는 다양한 테스트 조건에서 시스템 강인성을 향상시키는 데 기여하는가?
  • RQ5언어 불일치 조건에서 최고의 성능을 내기 위해 i-vector 추출 및 백엔드 기법의 어떤 조합이 가장 효과적인가?

주요 결과

  • 훈련 데이터는 영어이지만 테스트 데이터는 타갈로그어 및 광둥어인 상황에서 심각한 언어 불일치가 존재함에도 불구하고 시스템은 NIST SRE 2016 평가에서 경쟁 가능한 성능을 달성하였다.
  • 전사 없이도 비지도 언어 클러스터링이 언어 특화 패턴을 효과적으로 식별하였다.
  • 언어 간 변동성 보정이 다국어 차이로 인한 성능 저하를 상당히 줄였다.
  • 성별 및 언어에 의존하는 스코어 정규화가 비영어 테스트 시험에서 시스템 校정을 향상시키고 오류율을 감소시켰다.
  • 다양한 적응 기법의 통합이 다양한 언어 조건에서 더 강인하고 일반화 능력이 뛰어난 화자 인식 시스템을 구축하는 데 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.