[논문 리뷰] Machine Speech Chain with One-shot Speaker Adaptation
이 논문은 자기지도 학습을 통해 종합적으로 향상되는 엔드 투 엔드 음성 인식(ASR) 및 텍스트에서 음성으로 변환(TTS) 모델을 가능하게 하기 위해 화자 인식과 원샷 화자 적응을 통합한 기계적 음성 체인 프레임워크를 제안한다. 새로운 화자로부터의 단일 참조 샘플을 사용하여 TTS는 그 화자의 목소리로 음성을 생성할 수 있고, ASR는 다양한 화자 특성에 대한 학습을 통해 WSJ eval92에서 9.86% CER를 달성하여 7.12%의 상한선에 가까운 성능을 보였다.
In previous work, we developed a closed-loop speech chain model based on deep learning, in which the architecture enabled the automatic speech recognition (ASR) and text-to-speech synthesis (TTS) components to mutually improve their performance. This was accomplished by the two parts teaching each other using both labeled and unlabeled data. This approach could significantly improve model performance within a single-speaker speech dataset, but only a slight increase could be gained in multi-speaker tasks. Furthermore, the model is still unable to handle unseen speakers. In this paper, we present a new speech chain mechanism by integrating a speaker recognition model inside the loop. We also propose extending the capability of TTS to handle unseen speakers by implementing one-shot speaker adaptation. This enables TTS to mimic voice characteristics from one speaker to another with only a one-shot speaker sample, even from a text without any speaker information. In the speech chain loop mechanism, ASR also benefits from the ability to further learn an arbitrary speaker's characteristics from the generated speech waveform, resulting in a significant improvement in the recognition rate.
연구 동기 및 목표
- 다양한 화자 학습 중에 미리 보지 않은 화자를 다루는 데에 한계가 있는 이전 음성 체인 모델의 문제를 해결한다.
- 화자 인식을 루프에 통합하여 음성-텍스트 매핑 중 정보 손실을 완화한다.
- 단일 참조 샘플(원샷 적응)을 사용하여 TTS가 새로운 화자에게서의 음성으로 일반화할 수 있도록 한다.
- 적응된 TTS가 생성한 다양한 화자 특성을 통해 ASR 성능을 향상시킨다.
- 쌍화된 및 비쌍화된 음성-텍스트 데이터를 활용한 폐쇄 루프 프레임워크에서의 준지도 학습의 효과를 입증한다.
제안 방법
- 음성에서 화자 임베딩을 추출하기 위해 기계적 음성 체인 루프에 화자 인식 모델(DeepSpeaker)을 통합한다.
- TTS에서 단일 참조 화자 임베딩을 조건으로 하여 원샷 화자 적응을 사용하여 새로운 화자의 목소리로 음성을 생성한다.
- ASR와 TTS를 쌍화된(음성-텍스트) 및 비쌍화된(음성 전용 또는 텍스트 전용) 데이터를 함께 사용하여 피드백 루프를 통해 공동으로 훈련한다.
- ASR와 TTS 양쪽 모두에서 토이러너 포싱을 적용하여, 한 구성 요소의 예측 출력을 다른 구성 요소의 입력으로 사용한다.
- 비라벨 데이터를 활용하기 위해 ASR에서 텍스트를 생성하고 TTS에서 음성을 재구성함으로써 자기지도 학습을 가능하게 한다.
- 동일한 음성 신호에서 유도된 화자 임베딩을 사용하여 TTS를 조건화함으로써 단일 예제로부터의 음성 클로닝을 가능하게 한다.
실험 결과
연구 질문
- RQ1단일 참조 샘플만을 사용하여 기계적 음성 체인 모델이 새로운 화자를 효과적으로 다룰 수 있는가?
- RQ2화자 인식을 음성 체인 루프에 통합함으로써 다중 화자 데이터에서 ASR 및 TTS 성능이 어떻게 향상되는가?
- RQ3TTS에서의 원샷 화자 적응이 합성 음성의 다양성과 현실감을 어느 정도 향상시키는가?
- RQ4ASR와 TTS 사이의 폐쇄 루프 피드백 메커니즘이 준지도 학습 환경에서 상당한 성능 향상을 이끌어내는가?
- RQ5제안된 프레임워크는 광범위한 쌍화된 데이터가 필요 없이도 지도 학습의 상한선에 가까운 성능을 달성할 수 있는가?
주요 결과
- 제안된 음성 체인 모델은 SI84(쌍화된) 및 SI200(비쌍화된) 데이터를 사용한 준지도 학습을 통해 WSJ eval92 테스트 세트에서 9.86% CER를 달성하였으며, 베이스라인(17.35%) 및 레이블 전파(14.58%)보다 뚜렷이 뛰어난 성능을 보였다.
- 제안된 음성 체인을 사용한 TTS 모델은 로그-멜 스펙트로그램 L2-노름 제곱 오차가 0.886을 기록하였으며, 지도 학습 상한선인 0.836에 매우 가까웠다.
- 원샷 화자 적응 덕분에 TTS는 단일 참조 샘플만으로도 새로운 화자의 목소리로 고품질의 음성을 생성할 수 있었다.
- 적응된 TTS가 생성한 다양한 화자 특성을 가진 합성 음성을 통해 ASR 성능이 뚜렷이 향상되었다.
- 화자 인식을 루프에 통합함으로써 시스템은 화자 변동성을 효과적으로 모델링할 수 있었고, 음성 체인 내 정보 손실이 감소하였다.
- 모델는 이전 음성 체인 접근 방식이 고정된 화자 식별자에 의존했던 한계를 극복하고, 새로운 화자에 대한 강력한 일반화 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.