[논문 리뷰] Unsupervised Data Selection for TTS: Using Arabic Broadcast News as a Case Study
이 논문은 아랍어 방송 뉴스를 활용하여 DNSMOS, 모음 표기 및 ASR를 통한 타원 보정을 통해 자동 데이터 선택을 수행하는 완전히 비지도 학습 프레임워크를 제안한다. 단 한 시간의 선택된 데이터로 사전 학습된 자동적 순차적 TTS 모델에 의해 이끌리는 비순차적 FastSpeech2 모델을 미세조정함으로써, 이해 가능성에 대해 4.4점, 자연스러움에 대해 4.2점의 MOS를 달성하여 더 큰 데이터셋보다 높은 데이터 품질과 효율적인 학습 전략 덕분에 성능을 뛰어넘었다.
Several high-resource Text to Speech (TTS) systems currently produce natural, well-established human-like speech. In contrast, low-resource languages, including Arabic, have very limited TTS systems due to the lack of resources. We propose a fully unsupervised method for building TTS, including automatic data selection and pre-training/fine-tuning strategies for TTS training, using broadcast news as a case study. We show how careful selection of data, yet smaller amounts, can improve the efficiency of TTS system in generating more natural speech than a system trained on a bigger dataset. We adopt to propose different approaches for the: 1) data: we applied automatic annotations using DNSMOS, automatic vowelization, and automatic speech recognition (ASR) for fixing transcriptions' errors; 2) model: we used transfer learning from high-resource language in TTS model and fine-tuned it with one hour broadcast recording then we used this model to guide a FastSpeech2-based Conformer model for duration. Our objective evaluation shows 3.9% character error rate (CER), while the groundtruth has 1.3% CER. As for the subjective evaluation, where 1 is bad and 5 is excellent, our FastSpeech2-based Conformer model achieved a mean opinion score (MOS) of 4.4 for intelligibility and 4.2 for naturalness, where many annotators recognized the voice of the broadcaster, which proves the effectiveness of our proposed unsupervised method.
연구 동기 및 목표
- 저자원 TTS를 위한 고품질 쌍체 텍스트-오디오 데이터 부족 문제를 해결하기 위해 널리 보급되지만 품질이 낮은 방송 뉴스 녹음 자료를 활용하고자 한다.
- 비용이 많이 드는 인간 주석을 대체하기 위해 DNSMOS와 ASR 기반 오류 보정을 활용한 완전히 비지도 학습 데이터 선택 파이프라인을 개발하고자 한다.
- 원시 텍스트에 모음 표기를 적용하고 고자원 언어에서의 전이 학습을 통해 TTS 품질과 효율성을 향상시키고자 한다.
- 자동으로 선택된 더 작은 고품질 데이터셋이 더 큰 노이즈가 많은 데이터셋보다 TTS 성능에서 뛰어나다는 것을 입증하고자 한다.
- 기존 음성 코퍼스와 최소한의 인간 간섭을 통해 효율적이고 재현 가능한 저자원 언어용 TTS 학습을 가능하게 하고자 한다.
제안 방법
- 품질 기준으로 오디오 클립을 순위 매기는 데 DNSMOS를 사용하여 수동 주석을 대체하는 스케일러블하고 객관적인 지표로 자동 데이터 선택을 수행한다.
- 원시 텍스트에 자동 모음 표기를 적용하여 문자 오류율(CER)을 32.2%에서 3.9%로 감소시킨다.
- 방송 뉴스 데이터의 타원 오류를 보정하기 위해 자동 음성 인식(ASR)을 적용한다.
- 고자원 언어(예: 영어)에서 사전 학습된 자동적 순차적 TTS 모델(Tacotron2)을 활용하여 비순차적 FastSpeech2 기반 Conformer 모델를 이끌어내는 전이 학습을 수행한다.
- 고품질로 자동 선택된 방송 뉴스 데이터 단 1시간을 사용해 비순차적 모델을 미세조정한다.
- 최종 합성에서 음성의 자연스러움을 향상시키기 위해 WaveNet 기반 신경 음성 합성기(PWG)를 적용한다.
실험 결과
연구 질문
- RQ1DNSMOS와 같은 자동 지표가 저자원 TTS에서 전문가의 수동 주석과 유사한 데이터 선택 성능을 달성할 수 있는가?
- RQ2아랍어 원시 텍스트에 모음 표기를 적용할 경우, 비모음 표기된 원시 텍스트에 비해 TTS 성능에 어느 정도 향상이 이루어지는가?
- RQ3고자원 언어에서의 전이 학습이 아랍어에서 고품질 TTS 시스템을 학습하기 위한 데이터 요구량을 상당히 줄일 수 있는가?
- RQ4비지도 방법으로 자동 선택된 더 작은 고품질 데이터셋에서 학습하는 것이 더 큰 노이즈가 많은 데이터셋에서 학습하는 것보다 음성의 자연스러움과 이해 가능성 측면에서 뛰어나게 되는가?
- RQ5사전 학습된 자동적 순차적 교사 모델에 의해 이끄는 비순차적 TTS 모델이 단 1시간의 미세조정 데이터로도 높은 MOS 점수를 달성할 수 있는가?
주요 결과
- 제안된 DNSMOS 기반 비지도 데이터 선택은 수동 선택 시 3.9%에 근접한 CER 4.0%를 달성하여 자동 지표의 높은 신뢰성을 입증했다.
- 모음 표기 덕분에 CER가 32.2%에서 3.9%로 감소하여 텍스트 품질이 크게 향상되었고, 이는 더 나은 TTS 성능을 가능하게 했다.
- FastSpeech2 기반 Conformer 모델은 이해 가능성에 대해 4.4점, 자연스러움에 대해 4.2점의 MOS를 기록하여 단 1시간의 미세조정 데이터에도 불구하고 거의 뛰어난 음성 품질을 달성했다.
- 실제 녹음 데이터는 이해 가능성과 자연스러움 모두 4.9점의 MOS를 기록하여 청취자가 방송인의 목소리를 쉽게 식별할 수 있음을 보여주며, 합성 음성의 청각적 품질을 검증했다.
- 신경 음성 합성기(PWG) 적용으로 자연스러움과 이해 가능성 모두 향상되었으며, MOS는 각각 4.4점과 4.2점으로 상승하여 비순차적 TTS에서 고해상도 음성 합성기의 유용성을 확인했다.
- 감소 요소가 1이고 모음 표기가 적용된 모델(7V)이 더 높은 감소 요소를 가진 모델보다 성능이 뛰어나, 더 빠른 추론이 항상 품질을 향상시키는 것은 아니며, 데이터 품질이 속도보다 더 중요하다는 것을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.