[논문 리뷰] Synt++: Utilizing Imperfect Synthetic Data to Improve Speech Recognition
Synt++는 학습 중 실재 음성 데이터와 합성 음성 데이터 간의 분포 격차를 해결하기 위해 두 가지 핵심 기법을 사용함: 합성 샘플 중 품질이 낮은 것을 걸러내는 거부 샘플링과 학습 중 실재 및 합성 데이터에 대해 별도로 배치 정규화 통계를 유지하는 것. 이 방법은 단순히 합성 데이터를 사용하는 것과 비교해 WER를 최대 13% 감소시키고, 잘못 수락하는 비율을 최대 18% 감소시킴.
With recent advances in speech synthesis, synthetic data is becoming a viable alternative to real data for training speech recognition models. However, machine learning with synthetic data is not trivial due to the gap between the synthetic and the real data distributions. Synthetic datasets may contain artifacts that do not exist in real data such as structured noise, content errors, or unrealistic speaking styles. Moreover, the synthesis process may introduce a bias due to uneven sampling of the data manifold. We propose two novel techniques during training to mitigate the problems due to the distribution gap: (i) a rejection sampling algorithm and (ii) using separate batch normalization statistics for the real and the synthetic samples. We show that these methods significantly improve the training of speech recognition models using synthetic data. We evaluate the proposed approach on keyword detection and Automatic Speech Recognition (ASR) tasks, and observe up to 18% and 13% relative error reduction, respectively, compared to naively using the synthetic data.
연구 동기 및 목표
- 음성 인식 학습에서 실재 음성 데이터와 합성 음성 데이터 간의 분포 격차를 해결하기 위해.
- 부정확한 합성 데이터로 인한 아티팩트, 과도/부족 샘플링, 도메인 이탈 문제를 완화하기 위해.
- 완벽한 합성 데이터가 필요 없이도 합성 데이터를 활용해 ASR 및 키워드 검출 성능을 향상시키기 위해.
- 불완전한 합성 데이터를 사용할 때 모델의 강인성을 높이는 실용적인 프레임워크를 개발하기 위해.
제안 방법
- 합성 샘플을 실재 또는 합성로 분류하는 데 사용된 훈련된 판별기의 신뢰도를 기반으로 거부 샘플링 알고리즘을 사용해 합성 샘플을 걸러냄.
- 판별기는 실재 및 합성 음성 샘플을 구분하도록 훈련되며, 그 출력 확률이 합성 샘플의 확률적 수용 또는 기각을 이끌어냄.
- 학습 중 실재 및 합성 데이터에 대해 별도의 배치 정규화(BN) 통계를 계산하고 유지함.
- 추론 시에는 합성 데이터의 BN 통계가 도메인 이탈을 일으키지 않도록 실재 데이터의 BN 통계만 사용함.
- 모델 아키텍처에 변경 없이 ASR 및 키워드 검출 모델에 종단 간(end-to-end)으로 적용됨.
- 표준 평가 지표인 WER 및 잘못 수락 비율을 사용해 LibriSpeech 및 Speech Commands 데이터셋에서 평가됨.
실험 결과
연구 질문
- RQ1거부 샘플링은 합성 음성 데이터의 아티팩트와 분포 불일치가 ASR 성능에 미치는 영향을 줄일 수 있는가?
- RQ2실재 및 합성 데이터에 대해 별도의 배치 정규화 통계를 사용하면 모델의 일반화 능력 향상과 오차율 감소에 기여하는가?
- RQ3단순히 합성 데이터를 사용하는 것과 비교해 Synt++ 기법을 적용했을 때 ASR 및 키워드 검출 성능 향상은 어느 정도 이루어지는가?
- RQ4저자원 및 전자원 설정에서 다양한 모델 크기와 데이터 규모에서 Synt++는 어떻게 성능을 발휘하는가?
주요 결과
- LibriSpeech 960h 데이터셋에서 Synt++는 실재 및 합성 데이터를 단순히 사용하는 것과 비교해 상대적 WER 감소율을 최대 13% 기록함.
- LibriSpeech 100h 데이터셋에서 Synt++는 실재 및 합성 데이터를 사용한 베이스라인과 비교해 WER를 18% 감소시킴.
- 키워드 검출에서 Synt++는 필터링 없이 합성 데이터를 사용하는 것과 비교해 평균 잘못 수락 비율을 최대 18% 감소시킴.
- 제거 분석 결과, 거부 샘플링과 이중 배치 정규화 모두 성능 향상에 기여한다는 게 확인됨.
- 다양한 모델 크기(22M 및 116M 파라미터)와 데이터 설정에서 일관된 성능 향상이 이루어짐.
- 결과적으로 Synt++는 분포 이탈을 효과적으로 완화하고, 불완전한 합성 데이터의 신뢰성 있는 활용을 가능하게 함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.