Skip to main content
QUICK REVIEW

[논문 리뷰] Training Keyword Spotters with Limited and Synthesized Speech Data

James Lin, Kevin Kilgour|arXiv (Cornell University)|2020. 01. 31.
Speech Recognition and Synthesis참고 문헌 15인용 수 7
한 줄 요약

이 논문은 사전 훈련된 음성 임베딩 모델을 사용하여 실제 세계 훈련 데이터의 필요성을 극도로 줄이는 이단계 키워드 스트링 프레임워크를 제안한다. 임베딩 모델을 사용해 추출한 합성 음성 데이터에 대해 경량 헤드 모델을 피지터튜닝함으로써 정확도가 92.6%에 도달하며, 이는 4,000개 이상의 실제 예제로 훈련된 전체 모델과 동일한 성능을 보이며, 합성 데이터가 저자원 키워드 스트링 환경에서 비용이 많이 드는 실제 데이터를 효과적으로 대체할 수 있음을 보여준다.

ABSTRACT

With the rise of low power speech-enabled devices, there is a growing demand to quickly produce models for recognizing arbitrary sets of keywords. As with many machine learning tasks, one of the most challenging parts in the model creation process is obtaining a sufficient amount of training data. In this paper, we explore the effectiveness of synthesized speech data in training small, spoken term detection models of around 400k parameters. Instead of training such models directly on the audio or low level features such as MFCCs, we use a pre-trained speech embedding model trained to extract useful features for keyword spotting models. Using this speech embedding, we show that a model which detects 10 keywords when trained on only synthetic speech is equivalent to a model trained on over 500 real examples. We also show that a model without our speech embeddings would need to be trained on over 4000 real examples to reach the same accuracy.

연구 동기 및 목표

  • 저전력, 온디바이스 응용 프로그램에서 키워드 스트링 모델을 훈련하기 위한 데이터 수집 부담을 줄이기 위해.
  • 합성 음성 데이터가 소형이고 효율적인 키워드 스트링 모델 훈련에 실질적으로 실제 음성 데이터를 대체할 수 있는지 조사하기 위해.
  • 키워드 스트링을 위한 특징 추출기로 사전 훈련된 음성 임베딩 모델을 사용할 경우 성능 향상 여부를 평가하기 위해.
  • 데이터 요구량을 최소화하면서도 높은 정확도를 유지하기 위한 실제 데이터와 합성 데이터의 최적의 균형을 규명하기 위해.
  • 최소한의 실제 데이터로 스마트 기기용 맞춤형 키워드 감지기의 빠른 프로토타이핑을 가능하게 하기 위해.

제안 방법

  • 이중 단계 모델 아키텍처를 사용함: 사전 훈련된 330k 파라미터 음성 임베딩 모델과 키워드 검출을 위한 경량 55k 파라미터 헤드 모델.
  • 임베딩 모델은 2억 개의 유튜브 오디오 클립(키워드 포함 1억 개, 미포함 1억 개)으로 훈련되어 임의의 키워드 집합에 유용한 96차원 임베딩을 생성함.
  • 합성 음성은 타코트론 2 기반의 텍스트-음성 시스템을 사용해 헤드 모델의 훈련 데이터를 생성함.
  • 헤드 모델은 합성 또는 실제 예제로 피지터튜닝되며, 성능은 키워드 검출 정확도로 평가됨.
  • 제거 분석을 통해 실제 데이터만, 합성 데이터만, 혼합된 실제-합성 데이터로 훈련된 모델을 비교하여 데이터 효율성 평가.
  • 사전 훈련 중에 여러 키워드 검출 작업 간에 임베딩 기반 모델을 공유함으로써 전이 학습을 활용함.

실험 결과

연구 질문

  • RQ1오직 합성 음성 데이터로만 훈련된 키워드 스트링 모델이 대규모 실제 데이터로 훈련된 모델과 유사한 성능을 달성할 수 있는가?
  • RQ2사전 훈련된 임베딩 모델을 사용할 경우, 합성 데이터로 훈련된 모델의 성능을 따라잡기 위해 얼마나 많은 실제 데이터가 필요한가?
  • RQ3데이터 수집을 최소화하면서도 높은 검출 정확도를 유지하기 위해 실제 데이터와 합성 데이터의 최적 조합은 무엇인가?
  • RQ4음성 임베딩을 사용하면 효과적인 키워드 스트링 모델을 훈련하기 위해 필요한 실제 예제 수를 크게 줄일 수 있는가?
  • RQ5합성 데이터로 훈련된 경량 헤드 모델이 소수의 실제 예제로 훈련된 전체 모델보다 성능이 뛰어나게 될 수 있는가?

주요 결과

  • 오직 합성 음성 데이터로만 훈련된 키워드 스트링 모델이 92.6%의 정확도를 달성하며, 이는 키워드당 4,000개 이상의 실제 예제로 훈련된 전체 모델과 동일한 성능이다.
  • 음성 임베딩을 사용함으로써 실제 데이터 요구량이 90% 감소함: 키워드당 50개의 실제 예제로 훈련된 헤드 모델이 키워드당 500개의 실제 예제로 훈련된 전체 모델과 동일한 성능을 보임.
  • 3,000개의 실제 예제로 훈련된 헤드 모델이 임베딩을 사용할 경우 95.3%의 정확도를 달성하며, 기준 모델 대비 58%의 상대 오차 감소를 기록함.
  • 합성 데이터의 50%를 실제 데이터로 교체하면 정확도 격차가 90% 감소함으로써, 소량의 실제 데이터가 성능 향상에 크게 기여함을 시사함.
  • 키워드당 5개의 실제 예제만으로도 합성 데이터로만 훈련된 헤드 모델이 키워드당 125개의 실제 예제로 훈련된 전체 모델보다 성능이 뛰어남.
  • 합성 데이터로만 훈련된 헤드 모델은 전체 모델이 더 많은 파라미터를 가진다고 해도 항상 전체 모델보다 성능이 뛰어남.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.