[논문 리뷰] An ASR Guided Speech Intelligibility Measure for TTS Model Selection
이 논문은 입력 텍스트와 ASR로 복호화된 합성 음성 간의 전화 오류율(PER)을 계산하여 음성 이해도가 높은 텍스트-to-speech(TTS) 모델을 객관적 기준으로 선택하는 방법을 제안한다. 제안된 방법은 주관적 평가에서 학습 손실 기반 선택보다 뛰어나며, 특히 도메인 외 텍스트 장르를 대상으로 할 경우 이해도 향상이 뚜렷하며, 히нд어 데이터로 검증되었음에도 불구하고 다양한 언어에 적용 가능하다.
The perceptual quality of neural text-to-speech (TTS) is highly dependent on the choice of the model during training. Selecting the model using a training-objective metric such as the least mean squared error does not always correlate with human perception. In this paper, we propose an objective metric based on the phone error rate (PER) to select the TTS model with the best speech intelligibility. The PER is computed between the input text to the TTS model, and the text decoded from the synthesized speech using an automatic speech recognition (ASR) model, which is trained on the same data as the TTS model. With the help of subjective studies, we show that the TTS model chosen with the least PER on validation split has significantly higher speech intelligibility compared to the model with the least training-objective metric loss. Finally, using the proposed PER and subjective evaluation, we show that the choice of best TTS model depends on the genre of the target domain text. All our experiments are conducted on a Hindi language dataset. However, the proposed model selection method is language independent.
연구 동기 및 목표
- 음성 이해도 기반 TTS 모델 선택을 위한 객관적이고 확장 가능하며 인간 인지와 상관관계가 있는 메트릭의 부족을 해결하기 위해.
- TTS 모델 선택에서 학습 목표 손실(MSE 등)과 인간이 인지하는 음성 이해도 간의 낮은 상관관계를 극복하기 위해.
- 입력 텍스트와 ASR로 복호화된 합성 음성 간의 PER이 이해도 중심의 TTS 모델 선택을 위한 신뢰할 수 있고 언어에 관계없이 적용 가능한 객관적 메트릭이 될 수 있는지 조사하기 위해.
- 모델 선택이 대상 도메인 텍스트의 장르에 따라 어떻게 달라지는지, 특히 도메인 내 및 도메인 외 테스트 분할을 비교하여 평가하기 위해.
제안 방법
- 고정된 보코더를 사용하고 학습 에포크 동안 프론트엔드 모델만 변화시켜 TTS 시스템을 학습한다.
- TTS 모델과 동일한 데이터로 사전 학습된 ASR 시스템을 사용하여 합성 음성을 텍스트로 복호화하고, 입력 텍스트와 복호화된 텍스트 간의 전화 오류율(PER)을 계산한다.
- 검증 분할에서 PER가 가장 낮은 TTS 모델을 최종 모델로 선택하며, 학습 손실이 가장 낮은 모델이 아닌 것으로 한다.
- 표준 공식을 사용해 PER를 계산한다: PER = (S + D + I) / N, 여기서 S, D, I는 교체, 삭제, 삽입 수이고, N은 기준 전화의 총 수이다.
- 쌍별 비교를 통한 주관적 听음 테스트를 수행하여 PER 기반 선택 모델과 최소 손실 기반 선택 모델 간의 이해도 선호도를 평가한다.
- 두 가지 검증 분할에서 모델 성능을 비교한다: 하나는 학습과 유사한 도메인 내 텍스트이고, 다른 하나는 도메인 외 텍스트(예: 뉴스로 57.1%의 미사용어 사용)이다.
실험 결과
연구 질문
- RQ1입력 텍스트와 ASR로 복호화된 합성 음성 간의 PER이 더 높은 음성 이해도를 가진 TTS 모델 선택을 위한 신뢰할 수 있는 객관적 메트릭이 될 수 있는가?
- RQ2PER 기반 모델 선택이 인간이 인지하는 음성 이해도 측면에서 학습 손실 기반 선택보다 뛰어나게 성능을 발휘하는가?
- RQ3최적의 TTS 모델 선택이 대상 도메인 텍스트의 장르에 따라 어떻게 달라지는가, 특히 테스트 데이터가 학습 데이터와 다를 경우에 대해 어떻게 되는가?
- RQ4제안된 PER 기반 메트릭은 도메인 내 및 도메인 외 장르와 같은 다양한 텍스트 도메인에서 효과적이고 일반화 가능한가?
주요 결과
- 검증 분할에서 가장 낮은 PER를 기록한 TTS 모델은 최소 학습 목표 손실을 기록한 모델보다 유의미하게 높은 음성 이해도를 보였으며, 도메인 내 테스트에서 42.8%의 참가자가 PER 기반 선택 모델을 선호했고, 손실 기반 선택 모델은 28.1%에 그쳤다.
- 도메인 외 텍스트(예: 뉴스로 57.1%의 미사용어 포함)에서는 PER 기반 최적 모델이 에포크 550에 선택되었고, 손실 기반 최고 성능 모델은 에포크 710에 선택되었으며, 이는 모델 선택이 텍스트 장르에 따라 달라짐을 시사한다.
- PER 기반 선택 모델(MDL-PER-ID)은 18,251개의 기준 전화 중 13,983개를 정확히 탐지했고, 손실 기반 선택 모델(MDL-LOSS)은 13,612개를 탐지하여 전화 탐지 정확도 향상이 명확히 확인되었다.
- 도메인 외 테스트에서 48.9%의 참가자가 PER 기반 선택 모델(MDL-PER-OD)을 손실 기반 선택 모델(MDL-LOSS)보다 선호했으며, 이는 도메인 내 테스트에서 관찰된 것보다 더 강한 선호도를 보였다.
- 직접 비교했을 때 50%의 참가자가 PER 기반 선택 모델(MDL-PER-OD)과 도메인 내 PER 기반 선택 모델(MDL-PER-ID)의 음성 이해도를 동일하게 느꼈다. 이는 PER 기반 선택이 도메인 이동에 잘 적응함을 시사한다.
- 도메인 내 테스트에서는 55개의 고유 전화 중 29개, 도메인 외 테스트에서는 50개 중 29개에서 PER 기반 선택이 성능 향상을 보였고, 몇몇 전화에서만 약간의 성능 저하가 관찰되어 이해도 관련 성능 향상이 일관되게 유지됨을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.