Skip to main content
QUICK REVIEW

[논문 리뷰] JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification

Shinnosuke Takamichi, Ludwig Kürzinger|arXiv (Cornell University)|2021. 12. 17.
Speech Recognition and Synthesis인용 수 12
한 줄 요약

이 논문은 엔드 투 엔드 음성 인식(ASR) 및 발화자 검증(ASV)을 위한 YouTube 영상에서 자동으로 구축한 대규모 일본어 음성 코퍼스인 JTubeSpeech를 소개한다. CTC 기반 ASR를 활용한 오디오-자막 정렬 및 발화자 변동성 분석을 통한 필터링을 통해 언어 특화 처리를 최소화한 방법을 사용한다. 이 코퍼스는 ASR용 1,300시간 이상, ASV용 900시간의 훈련 데이터를 제공하며, 초기 ASV 벤치마크에서 EER 10.9%의 최신 기술 수준 성능을 달성한다.

ABSTRACT

In this paper, we construct a new Japanese speech corpus called "JTubeSpeech." Although recent end-to-end learning requires large-size speech corpora, open-sourced such corpora for languages other than English have not yet been established. In this paper, we describe the construction of a corpus from YouTube videos and subtitles for speech recognition and speaker verification. Our method can automatically filter the videos and subtitles with almost no language-dependent processes. We consistently employ Connectionist Temporal Classification (CTC)-based techniques for automatic speech recognition (ASR) and a speaker variation-based method for automatic speaker verification (ASV). We build 1) a large-scale Japanese ASR benchmark with more than 1,300 hours of data and 2) 900 hours of data for Japanese ASV.

연구 동기 및 목표

  • ASR 및 ASV를 위한 대규모 오픈소스 일본어 음성 코퍼스의 부족을 해결하기 위해.
  • YouTube에서 음성 데이터를 수집하고 필터링하는 언어에 관계없이 적용 가능한 자동화된 파이프라인을 개발하기 위해.
  • 엔드 투 엔드 모델 훈련에 적합한 현대적인 크기와 고품질의 코퍼스를 구축하기 위해.
  • 측정 가능한 성능을 보여주기 위해 일본어 ASR 및 ASV를 위한 벤치마크를 구축함으로써 방법의 효과성을 입증하기 위해.

제안 방법

  • 자동화된 검색 쿼리를 사용해 YouTube에서 영상-오디오 및 자막 데이터를 크롤링하기.
  • CTC 기반 ASR와 CTC 분할 기법을 적용해 자막과 오디오를 정렬하고, 필터링을 위한 신뢰도 점수를 계산하기.
  • 영상 내 발화자 표현의 변동성을 활용해 단일 발화자, 다중 발화자, TTS 유사 콘텐츠를 분류하고 필터링하기.
  • VAD와 사전 학습된 d-벡터를 사용해 영상 내 발화자 변동성을 계산하여 데이터 정제하기.
  • ASV 설정에서 등록 및 테스트를 위해 단일 발화자 영상에서 고유한 발화자를 선별하기.
  • ASV 평가를 위해 40차원의 로그-멜 특징과 512차원의 임베딩을 사용하는 CNN 기반의 발화자 임베딩 모델 훈련하기.

실험 결과

연구 질문

  • RQ1언어에 크게 의존하지 않는 방법이 YouTube에서 일본어 ASR 및 ASV를 위한 고품질 음성 데이터를 효과적으로 수집하고 필터링할 수 있는가?
  • RQ2YouTube에서 자동으로 수집한 데이터의 양이 증가함에 따라 ASR 모델의 성능은 어떻게 변화하는가?
  • RQ3비정형적인 YouTube 영상에서 발화자 변동성 분석이 단일 발화자 콘텐츠와 다중 발화자 또는 합성 음성 콘텐츠를 신뢰성 있게 구분할 수 있는가?
  • RQ4자동화된 필터링을 통해 구축한 대규모 오픈소스 일본어 코퍼스를 기반으로 훈련된 발화자 검증 시스템의 성능은 어떠한가?

주요 결과

  • JTubeSpeech 코퍼스는 일본어 ASR용 1,300시간 이상의 훈련 데이터를 포함하며, 이는 이전 기준인 CSJ(600시간)를 크게 초월한다.
  • 더 많은 훈련 데이터를 사용할수록 ASR 성능이 일관되게 향상되었으며, 최적의 점수 임계값을 사용해 1,376시간의 데이터로 dev_easy에서 6.9%의 WER를 달성했다.
  • CTC 분할 기법을 적용한 결과, 원본 YouTube 타이밍을 사용한 경우 대비 dev_easy에서 2.3%p, dev_normal에서 2.2%p의 ASR 성능 향상을 기록했다.
  • 발화자 변동성 기반 필터링 방법은 영상 유형 분류에 높은 정확도를 보였으며, 레이블링된 단일 발화자 영상의 95%가 정확히 분류되었다.
  • ASV 시스템은 초기 벤치마크에서 등가오류률(EER) 10.9%를 기록했으며, VoxCeleb1에서 훈련된 모델과 비교해 뛰어난 성능을 보였다.
  • 코퍼스 구축 파이프라인은 언어에 특화된 처리를 최소화하여 다른 언어로도 높은 재현성이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.