Skip to main content
QUICK REVIEW

[논문 리뷰] SpecAugment on Large Scale Datasets

Daniel Park, Yu Zhang|arXiv (Cornell University)|2019. 12. 11.
Speech Recognition and Synthesis참고 문헌 26인용 수 4
한 줄 요약

이 논문은 원시 음성 입력의 스펙트로그램 수준에서 데이터 증강 기법인 SpecAugment가 Google의 다중도메인 데이터셋과 LibriSpeech 960h와 같은 대규모 산업용 데이터셋에서 엔드 투 엔드 음성 인식(ASR) 성능을 크게 향상시킴을 보여준다. SpecAugment를 다중스타일 훈련(MTR) 데이터와 혼합하여 사용함으로써 저비용이고 확장 가능한 방식으로 최신 기술 수준의 성능—LibriSpeech test-clean에서 2.2% WER, test-other에서 5.2% WER—을 달성하였다.

ABSTRACT

Recently, SpecAugment, an augmentation scheme for automatic speech recognition that acts directly on the spectrogram of input utterances, has shown to be highly effective in enhancing the performance of end-to-end networks on public datasets. In this paper, we demonstrate its effectiveness on tasks with large scale datasets by investigating its application to the Google Multidomain Dataset (Narayanan et al., 2018). We achieve improvement across all test domains by mixing raw training data augmented with SpecAugment and noise-perturbed training data when training the acoustic model. We also introduce a modification of SpecAugment that adapts the time mask size and/or multiplicity depending on the length of the utterance, which can potentially benefit large scale tasks. By using adaptive masking, we are able to further improve the performance of the Listen, Attend and Spell model on LibriSpeech to 2.2% WER on test-clean and 5.2% WER on test-other.

연구 동기 및 목표

  • 공개 벤치마크를 초월한 대규모 다중도메인 ASR 데이터셋에서 SpecAugment의 효과를 평가하는 것.
  • 산업 규모 환경에서 Multistyle Training(MTR)과 같은 더 복잡한 데이터 증강 기법보다 SpecAugment가 성능을 뛰어넘거나 보완할 수 있는지 조사하는 것.
  • 발화 길이에 따라 조정되는 적응형 시간 마스킹 정책을 탐색하여 다양한 길이의 입력에 대한 일반화 능력을 향상시키는 것.
  • SpecAugment가 레이어 정규화로 인한 훈련 불안정성에도 불구하고 스트리밍 ASR 모델, 특히 RNN-T 아키텍처에서 성능 향상을 이끌 수 있음을 입증하는 것.

제안 방법

  • 원시 음성 입력의 스펙트로그램에 시간 왜곡, 주파수 마스킹, 시간 마스킹을 포함한 SpecAugment를 직접 적용한다.
  • 청소된 훈련 데이터에 대해 시간 왜곡 없이 두 개의 주파수 마스킹(F=27)과 두 개의 시간 마스킹(T=50)을 포함한 고정 정책(SpecAugBasic)을 사용한다.
  • 발화 길이에 따라 마스크의 수와 크기가 변하는 적응형 시간 마스킹을 도입하여 장기 및 단기 시퀀스에서의 일반화 능력을 향상시킨다.
  • SpecAugmented 청소된 데이터와 MTR로 증강된 데이터를 8:2 비율로 혼합하여 도메인 일반화와 내성 강도를 균형 잡는다.
  • 레이어 정규화로 인한 기울기 불안정성을 보완하기 위해 마스킹 영역에 가우시안 노이즈를 주입함으로써 스트리밍 RNN-T 모델의 훈련을 안정화시킨다.
  • 자연 도메인(예: 검색, 통화, 유튜브)과 MTR를 통해 생성된 합성 도메인(예: 검색-노이즈)을 포함한 여러 테스트 세트에서 훈련 및 평가를 수행한다.

실험 결과

연구 질문

  • RQ1Google의 다중도메인 데이터셋과 같은 대규모 다중도메인 산업용 데이터셋에서 SpecAugment가 성능 향상을 유지하는가?
  • RQ2산업용 ASR에 최신 기술 수준의 데이터 증강 방법인 Multistyle Training(MTR)과 비교하거나 보완할 수 있는가?
  • RQ3발화 길이에 따라 마스크 파라미터가 변하는 적응형 시간 마스킹이 고정 사양의 SpecAugment보다 대규모 작업에서 성능 향상을 이끌 수 있는가?
  • RQ4레이어 정규화로 인한 훈련 불안정성에도 불구하고 SpecAugment가 스트리밍 ASR 모델, 특히 RNN-T에서 측정 가능한 성능 향상을 제공하는가?
  • RQ5다양한 테스트 도메인에서 성능을 극대화하기 위해 SpecAugment와 MTR 데이터를 최적의 전략으로 조합하는 방법은 무엇인가?

주요 결과

  • 청소된 데이터에 SpecAugment를 적용한 결과, 자연 테스트 세트(예: 검색, 통화, 유튜브) 전반에서 MTR 베이스라인을 능가하여 검색에서 6.2% WER, 통화에서 4.2% WER를 기록하였다.
  • MTR로 증강된 데이터 위에 SpecAugment를 적용할 경우 대부분의 도메인에서 성능이 악화되어 두 방법 간의 부정적 상호작용이 있음을 시사한다.
  • SpecAugmented 청소된 데이터 80%와 MTR로 증강된 데이터 20%를 혼합한 조합이 전체적으로 가장 우수한 성능을 보였으며, 각각의 방법을 별도로 사용한 것보다 모든 테스트 세트에서 WER가 향상되었다.
  • LibriSpeech 960h에서 SpecAugment의 적응형 시간 마스킹 변형은 test-clean에서 2.2% WER, test-other에서 5.2% WER로 감소시켜 원래 SpecAugment 논문에서 보고한 베이스라인 성능을 초월하였다.
  • 시간 마스킹만으로도 레이어 정규화와 함께 스트리밍 RNN-T 모델에서 상당한 성능 향상을 이끌 수 있었으며, 특히 마스킹 영역에 노이즈를 주입하여 안정화한 경우에 더욱 두드러졌다.
  • 적응형 시간 마스킹은 Google의 다중도메인 데이터셋에서는 고정 정책를 능가하지 못했지만, LibriSpeech에서는 측정 가능한 성능 향상을 보였으며, 이는 적응형 전략이 도메인에 따라 유의미한 이점을 가질 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.