Skip to main content
QUICK REVIEW

[논문 리뷰] LIA system description for NIST SRE 2016

Mickaël Rouvier, Pierre-Michel Bousquet|arXiv (Cornell University)|2016. 12. 15.
Speech Recognition and Synthesis참고 문헌 4인용 수 5
한 줄 요약

이 논문은 2016년 NIST 음성인식 평가를 위한 LIA 시스템을 제시한다. 이 시스템은 i-vector/PLDA 프레임워크를 기반으로 하며, 다양한 프론트엔드(MFCC, PLP), i-vector 추출 방법(UBM, DNN, 두 개의 특징 포스터리어), 그리고 데이터 이동 기법(IDVC, 평균 이동)을 사용한 여덟 개인 서브시스템을 포함한다. 주요 기여는 이러한 서브시스템의 점수 수준 융합으로, 중국어 남성 집합에서 최소 주요 비용(minC)이 0.224이고 EER이 5.39%에 도달하여 개별 서브시스템을 초월하는 성능을 달성하였다.

ABSTRACT

This paper describes the LIA speaker recognition system developed for the Speaker Recognition Evaluation (SRE) campaign. Eight sub-systems are developed, all based on a state-of-the-art approach: i-vector/PLDA which represents the mainstream technique in text-independent speaker recognition. These sub-systems differ: on the acoustic feature extraction front-end (MFCC, PLP), at the i-vector extraction stage (UBM, DNN or two-feats posteriors) and finally on the data-shifting (IDVC, mean-shifting). The submitted system is a fusion at the score-level of these eight sub-systems.

연구 동기 및 목표

  • 어려운 언어 및 채널 불일치 조건 하에서 2016년 NIST SRE 평가를 위한 강건한 음성인식 시스템을 개발하기 위해.
  • 다양한 음성 프론트엔드(MFCC, PLP), i-vector 추출 방법(UBM, DNN, 두 개 특징 포스터리어), 그리고 데이터 이동 기법(IDVC, 평균 이동)이 시스템 성능에 미치는 영향을 조사하기 위해.
  • 다중 i-vector 서브시스템의 점수 수준 융합을 통해 정확도를 향상시키기 위해.
  • 다양한 언어 및 성별 조건에서 주요 지표인 minC 주요 비용을 최적화하기 위해.

제안 방법

  • 음성 특징(MFCC 및 PLP)은 Kaldi 툴킷을 사용하여 추출되었으며, 60차원의 벡터로 구성되었으며, 치수 계수와 그 일阶 및 이阶 도함수를 포함하였다.
  • 음성 활성도 검출(VAD)은 11프레임의 공통 창을 기반으로 한 로그 에너지 임계값 기반 방법을 사용하여 침묵 및 저에너지 세그먼트를 제거하였다.
  • i-벡터는 세 가지 방법으로 추출되었다: UBM 기반 GMM, 4개의 은닉층(각각 1024개 노드)을 가진 DNN 기반 포스터리어, 그리고 MFCC 및 PLP 스트림을 결합한 두 개 특징 포스터리어.
  • i-벡터 정규화는 LW-정규화(백색화 및 길이 정규화)를 통해 수행되었으며, 이후 PLDA 후처리 정규화가 이루어져, 클래스 간 및 클래스 내 공분산 행렬을 대각화하였다.
  • 언어 불일치 문제를 완화하기 위해 두 가지 데이터 이동 기법인 데이터 간 변동성 보정(IDVC)과 평균 이동 기법이 적용되었다.
  • PLDA 점수 계산은 비전통적 PLDA 모델을 사용하였으며, 최종 점수는 개별 시스템 점수의 완전한 정규화 및 융합 후 생성되었다.

실험 결과

연구 질문

  • RQ1i-vector/PLDA 프레임워크 내에서 다양한 음성 프론트엔드(MFCC 대비 PLP)가 음성인식 성능에 미치는 영향은 무엇인가?
  • RQ2기존의 UBM 대비 DNN 기반 포스터리어 또는 두 개 특징 포스터리어를 사용한 i-vector 추출이 성능 향상에 기여하는 정도는 어느 정도인가?
  • RQ3IDVC 및 평균 이동 데이터 이동 기법이 언어 불일치로 인한 성능 저하를 어느 정도 감소시키는가?
  • RQ4다중 i-vector 서브시스템의 점수 수준 융합이 전체 음성인식 정확도 향상에 얼마나 효과적인가?
  • RQ5최소 주요 비용(minC) 및 EER을 최대화하기 위해 프론트엔드, 백엔드 및 정규화 기법의 최적 조합은 무엇인가?

주요 결과

  • 융합 시스템(Fusion B)은 중국어 남성 집합에서 minC 주요 비용 0.224과 EER 5.39%를 기록하여, 제출된 모든 시스템 중 최고 성능을 달성하였다.
  • MFCC, DNN 기반 i-벡터, 평균 이동을 사용한 서브시스템(System 6)은 세부아노 여성 집합에서 EER 6.75%를 기록하여, 비모국어 조건에서 강력한 내성성을 보였다.
  • 여덟 개 서브시스템의 융합(Fusion B)은 중국어 남성 집합에서 EER을 5.39%로 낮추었고, 남성+여성 집합을 균형화한 경우 16.90%로 감소시켜, 다양한 조건에서 일관된 성능 향상을 입증하였다.
  • 두 개 특징 i-벡터 방법(MFCC + PLP)은 세부아노 남성 집합(EER=22.77%)과 중국어 여성 집합(EER=15.24%)에서 최고 성능을 기록하여, 향상된 내성성을 입증하였다.
  • PLDA 공분산 행렬을 대각화하고 추가적인 LW-정규화를 적용하는 후처리 정규화 단계가 일반화 능력을 향상시키고, 훈련 데이터와 테스트 데이터 간의 이동을 감소시키는 데 기여하였다.
  • 전체 시스템은 평균 1 utterance당 3.66초의 CPU 시간을 소비하였으며, 가장 계산 비용이 높은 단계는 i-벡터 통계 계산(1.33초)이었으며, 이는 실시간 적용 가능성에 유리하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.