Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-supervised acoustic modelling for five-lingual code-switched ASR using automatically-segmented soap opera speech

Nicholas I. Wilkinson, Astik Biswas|arXiv (Cornell University)|2020. 04. 08.
Speech Recognition and Synthesis참고 문헌 33인용 수 7
한 줄 요약

이 논문은 CNN 기반 음성 활성도 검출(VAD)에 GMM-HMM 스무딩과 화자 다이어라이제이션을 활용하여 자동으로 분할된 소프라 오페라 음성 데이터를 이용해 다섯 언어가 혼합된 코드스위칭 음성에 대한 준감독형 자동 음성 인식(ASR) 시스템을 제안한다. 최고 성능을 보인 방법은 수동 분할 대비 1.1%p의 절대 WER 향상을 달성하여, 자동 분할 기술이 자원이 부족한 多언어 환경에서 완전히 스케일러블하고 고성능의 ASR를 가능하게 한다는 것을 입증한다.

ABSTRACT

This paper considers the impact of automatic segmentation on the fully-automatic, semi-supervised training of automatic speech recognition (ASR) systems for five-lingual code-switched (CS) speech. Four automatic segmentation techniques were evaluated in terms of the recognition performance of an ASR system trained on the resulting segments in a semi-supervised manner. The system's output was compared with the recognition rates achieved by a semi-supervised system trained on manually assigned segments. Three of the automatic techniques use a newly proposed convolutional neural network (CNN) model for framewise classification, and include a novel form of HMM smoothing of the CNN outputs. Automatic segmentation was applied in combination with automatic speaker diarization. The best-performing segmentation technique was also tested without speaker diarization. An evaluation based on 248 unsegmented soap opera episodes indicated that voice activity detection (VAD) based on a CNN followed by Gaussian mixture modelhidden Markov model smoothing (CNN-GMM-HMM) yields the best ASR performance. The semi-supervised system trained with the resulting segments achieved an overall WER improvement of 1.1% absolute over the system trained with manually created segments. Furthermore, we found that system performance improved even further when the automatic segmentation was used in conjunction with speaker diarization.

연구 동기 및 목표

  • 자원이 부족한 환경에서 다섯 언어가 혼합된 코드스위칭 음성에 대해 준감독형 ASR 성능에 자동 분할 기술이 미치는 영향을 평가하기 위해.
  • 에너지 기반 VAD부터 CNN-HMM, CNN-GMM-HMM에 이르기까지 다양한 자동 분할 기술이 인식 정확도에 미치는 영향을 비교하기 위해.
  • 자동 분할과 화자 다이어라이제이션을 조합했을 때 수동 분할 데이터의 성능을 도달하거나 초월할 수 있는지 평가하기 위해.
  • 자원이 부족한 환경에서 다국어, 코드스위칭 음성에 대해 완전히 자동화되고 스케일러블한 ASR 학습 파이프라인의 실현 가능성을 탐색하기 위해.

제안 방법

  • 다음 네 가지 자동 분할 기법을 평가하였다: (1) 에너지 기반 VAD에 화자 다이어라이제이션을 적용한 방법, (2) CNN 기반 프레임 단위 분류에 HMM 스무딩과 다이어라이제이션을 적용한 방법, (3) CNN에 GMM-HMM 스무딩과 다이어라이제이션을 적용한 방법, (4) CNN에 GMM-HMM 스무딩만 적용하고 다이어라이제이션을 생략한 방법.
  • 프레임 단위로 음성, 음악, 잡음을 분류하기 위해 새로운 CNN 모델을 학습하였으며, 이후 HMM 스무딩을 통해 시간적 경계를 정밀하게 보정하였다.
  • 세그먼트에 화자 신원을 할당하기 위해 X-vector DNN 임베딩을 사용하여 화자 다이어라이제이션을 수행하였으며, 이는 분할 정확도 향상에 기여하였다.
  • 준감독 학습은 21시간의 수동으로 타이핑된 음성과 11시간의 수동으로 분할된 음성 데이터로 학습된 강력한 베이스라인 시스템으로부터 생성된 가짜 레이블을 활용하였다.
  • 최종 ASR 시스템은 248편의 분할되지 않은 소프라 오페라 에피소드를 대상으로 평가되었으며, 수동 분할 기반 베이스라인과의 성능을 비교하였다.
  • 시스템 성능는 단어 오류율(WER)과 코드스위칭 바이그램 정확도(Bi CS)를 통해 측정되었으며, 언어 전환 지점에서의 성능을 중심으로 평가하였다.

실험 결과

연구 질문

  • RQ1CNN 기반 VAD에 GMM-HMM 스무딩을 적용한 자동 분할 기술이 다섯 언어가 혼합된 코드스위칭 음성에서 수동 분할과 유사한 ASR 성능을 달성할 수 있는가?
  • RQ2화자 다이어라이제이션은 자동 분할된 ASR 시스템의 성능에 어떤 영향을 미치는가?
  • RQ3자동 분할된 비타이핑된 소프라 오페라 데이터를 활용한 준감독 학습이 수동 분할 대비 WER 및 코드스위칭 정확도 향상에 기여하는가?
  • RQ4자원이 부족한 다국어 코드스위칭 환경에서 다양한 자동 분할 기술이 ASR 성능에 미치는 상대적 영향은 어떠한가?

주요 결과

  • 화자 다이어라이제이션을 통합한 CNN-GMM-HMM VAD가 가장 뛰어난 ASR 성능을 보였으며, 이는 수동 분할 기반 베이스라인 대비 WER이 1.1%p 절대적으로 향상된 결과를 보였다.
  • 자동 분할된 데이터로 학습된 시스템은 수동 분할된 데이터로 학습된 시스템과 동일하거나 略적으로 높은 성능을 보였으며, 이는 자동 분할 기술이 실질적인 대안이 될 수 있음을 시사한다.
  • 화자 다이어라이제이션을 통합함으로써 특히 코드스위칭 지점에서 인식 정확도가 크게 향상되었으며, 이는 다국어 환경에서의 유용성을 확인한다.
  • 다섯 언어가 혼합된 준감독형 시스템(I번 시스템)은 모든 双어 시스템보다 뛰어나며, 가장 가까운 경쟁자(F번 시스템) 대비 0.5%p 절대적인 WER 향상을 달성했으며, 이는 통계적으로 유의미하였다.
  • 모든 준감독형 시스템에서 언어별 WER 및 Bi CS 점수는 상당히 향상되었으며, 수동 분할 및 자동 분할 데이터 간 유의미한 차이는 없었다.
  • 결과적으로 자동 분할에 화자 다이어라이제이션을 통합하면 자원이 부족한 다국어 코드스위칭 음성에 대해 스케일러블하고 고성능의 ASR를 실현할 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.