[논문 리뷰] Exploring Machine Speech Chain for Domain Adaptation and Few-Shot Speaker Adaptation
이 논문은 타겟 도메인의 텍스트 데이터만을 사용하여 TTS→ASR 공동 학습을 활용해 도메인 및 소수 샘플 스피커 적응을 위한 머신 스피치 체인 프레임워크를 제안한다. 타겟 도메인 텍스트에서 합성 음성 생성과 ASR 피드백을 통해, E2E ASR에서 10% 상대적 WER 감소와 TED-LIUM에서 TTS 생성 음성에서 51.5% 상대적 WER 감소를 달성하였으며, 소수 샘플 스피커 적응을 통해 추가로 2.6% 상대적 WER 향상을 얻었다.
Machine Speech Chain, which integrates both end-to-end (E2E) automatic speech recognition (ASR) and text-to-speech (TTS) into one circle for joint training, has been proven to be effective in data augmentation by leveraging large amounts of unpaired data. In this paper, we explore the TTS->ASR pipeline in speech chain to do domain adaptation for both neural TTS and E2E ASR models, with only text data from target domain. We conduct experiments by adapting from audiobook domain (LibriSpeech) to presentation domain (TED-LIUM), there is a relative word error rate (WER) reduction of 10% for the E2E ASR model on the TED-LIUM test set, and a relative WER reduction of 51.5% in synthetic speech generated by neural TTS in the presentation domain. Further, we apply few-shot speaker adaptation for the E2E ASR by using a few utterances from target speakers in an unsupervised way, results in additional gains.
연구 동기 및 목표
- E2E ASR와 신경 TTS에서 발생하는 텍스트 도메인 및 스피커 변동성 불일치 문제를 공동 학습 프레임워크를 통해 해결하기 위해.
- 타겟 도메인의 쌍화된 음성-텍스트 데이터가 필요 없이 ASR와 TTS의 도메인 적응을 가능하게 하기 위해.
- TTS에서 합성 음성 생성과 ASR 피드백을 활용하여 비지도 소수 샘플 스피커 적응을 탐색하기 위해.
- 머신 스피치 체인의 효과성을 평가하여 도메인 외 텍스트와 익명 스피커에 대한 강건성과 성능 향상을 도모하기 위해.
제안 방법
- 이 방법은 TTS→ASR 파이프라인을 머신 스피치 체인 내에서 활용하며, TTS가 타겟 도메인 텍스트에서 합성 음성을 생성하고, ASR가 교차 엔트로피 손실을 통해 피드백을 제공하여 양 모델을 향상시킨다.
- 공동 학습은 합성 음성에 대한 ASR 손실을 사용하여 ASR 및 TTS 모델을 동시에 업데이트함으로써, 타겟 도메인의 음성적 및 언어적 표현을 학습할 수 있도록 한다.
- 도메인 적응을 위해 TTS 모델은 타겟 도메인(TED-LIUM)의 텍스트를 사용하여 미세 조정되고, ASR 모델은 생성된 합성 음성으로 훈련되어 도메인 불일치를 감소시킨다.
- 소수 샘플 스피커 적응을 위해 타겟 스피커의 소수의 기준 발화 문장을 사용하여 TTS 모델을 조건화하고, 이를 통해 ASR 미세 조정용 스피커 특화 합성 음성을 생성한다.
- 프레임워크는 주의 기반 E2E ASR와 Tacotron2 기반 TTS를 사용하며, 훈련 안정성과 성능 향상을 위해 유도 주의 및 교차 엔트로피 손실을 적용한다.
- 훈련 전략으로는 양 모델의 공동 최적화와 TTS를 고정한 채로 오직 ASR만을 미세 조정하는 전략을 포함하여, 성능 및 강건성에 미치는 영향을 평가한다.
실험 결과
연구 질문
- RQ1머신 스피치 체인 내 TTS→ASR 파이프라인이 타겟 도메인 텍스트만을 사용하여 ASR와 TTS의 도메인 불일치를 효과적으로 줄일 수 있는가?
- RQ2TTS와 ASR의 공동 학습이 도메인 외 텍스트에 대한 신경 TTS의 주의 오류를 줄이고 강건성을 향상시키는 데 어떻게 기여하는가?
- RQ3합성 음성 생성과 ASR 피드백을 활용한 스피치 체인 프레임워크에서 비지도 소수 샘플 스피커 적응은 어느 정도 실현 가능한가?
- RQ4공동 학습을 통해 타겟 도메인의 합성 데이터를 활용하면, 소스 도메인 성능이 저하되지 않은 채 실제 타겟 도메인 테스트 세트에서 ASR 성능이 향상되는가?
주요 결과
- 제안된 도메인 적응 방법은 TED-LIUM 테스트 세트에서 E2E ASR의 WER을 25.9%에서 23.3%로 10% 상대적 감소시켰다.
- 신경 TTS는 타겟 도메인 텍스트에서 생성한 합성 음성에서 51.5% 상대적 WER 감소를 보였으며, 주의 강건성 향상이 뚜렷하게 나타났다.
- 소스 도메인(LibriSpeech)에서 TTS 성능도 상대적으로 16.9% 향상되어 공동 학습의 일반화 이점이 확인되었다.
- 스피커 적응에 단 한 개의 기준 발화 문장만을 사용해도 ASR WER이 2.6% 상대적으로 감소하였으며, 다섯 개의 기준 문장을 사용할 경우 추가로 성능 향상이 있었다.
- ASR와 TTS를 함께 공동 학습하면 TTS의 강건성이 향상되었고, 오직 ASR만을 미세 조정한 경우는 약간 더 높은 ASR 성능을 기록하여, 모델 향상 간의 상충 관계가 있음을 시사했다.
- 시각적 분석을 통해 공동 학습 후 Tacotron2의 주의 정렬이 향상되었으며, 특히 도메인 외 텍스트에서 두드러져 주의 오류 감소가 검증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.