[논문 리뷰] Variation and Synthetic Speech
이 논문은 포괄적 다국어 발음 사전과 조정 가능한 후어휘 모듈을 사용하여 신경망 기반 접근법을 통해 합성 음성에서 언어적 변이를 모델링한다. 재학습을 통해 개별 화자별 발음 변이를 학습함으로써, 각 화자에 대해 광범위한 수동 음소 표기 작업 없이도 합성 음성의 자연스러움을 향상시킨다.
We describe the approach to linguistic variation taken by the Motorola speech synthesizer. A pan-dialectal pronunciation dictionary is described, which serves as the training data for a neural network based letter-to-sound converter. Subsequent to dictionary retrieval or letter-to-sound generation, pronunciations are submitted a neural network based postlexical module. The postlexical module has been trained on aligned dictionary pronunciations and hand-labeled narrow phonetic transcriptions. This architecture permits the learning of individual postlexical variation, and can be retrained for each speaker whose voice is being modeled for synthesis. Learning variation in this way can result in greater naturalness for the synthetic speech that is produced by the system.
연구 동기 및 목표
- 지역적 및 개인별 발음 변이를 반영하는 자연스러운 합성 음성을 생성하는 데 도전하는 것.
- 모든 화자에 대해 완전한 음소 표기를 요구하지 않는, 확장 가능하고 조정 가능한 시스템을 개발하여 후어휘 음소 변이를 포착하는 것.
- 개별 화자 데이터로 후어휘 신경망을 재학습하여 합성 음성의 화자별 적응을 가능하게 하는 것.
- 한 개의 발음 사전에 다국어 다양성을 통합하면서도 음성 합성의 음소 정확성과 자연스러움을 유지하는 것.
제안 방법
- 글자에서 음소로의 변환(L2S) 신경망 학습을 위한 포괄적 다국어 발음 사전을 구축한다.
- L2S 모델이 텍스트 입력에서 초도 발음을 생성하고, 이를 후어휘 신경망으로 전달한다.
- 후어휘 모듈은 정렬된 사전 발음과 수동으로 라벨링된 좁은 음소 표기로 훈련되어, 화자별 음소 변이를 모델링한다.
- 각 대상 화자에 대해 그들의 음성 데이터로 후어휘 네트워크를 재학습함으로써 개인화된 발음 모델링이 가능해진다.
- 시스템은 입력 텍스트와 출력 음소 시퀀스 사이의 복잡한 비선형 맵핑을 화자별 특성과 함께 학습하는 데 신경망을 활용한다.
- 이 아키텍처는 다국어 및 개인별 변이 패턴을 종단 간(end-to-end)으로 학습할 수 있도록 하여 합성 음성의 자연스러움을 향상시킨다.
실험 결과
연구 질문
- RQ1단일 음성 합성 시스템이 어떻게 다수의 다국어 발음 변이를 효과적으로 모델링할 수 있는가?
- RQ2조정 가능한 후어휘 모듈이 개인 화자별 음소 변이를 포착하는 데 어떤 역할을 하는가?
- RQ3모든 화자에 대해 완전한 음소 표기를 요구하지 않고도 신경망을 효과적으로 사용하여 후어휘 발음 규칙을 학습하고 적용할 수 있는가?
- RQ4후어휘 모듈을 화자별로 재학습하면 합성 음성의 자연스러움이 어떻게 향상되는가?
주요 결과
- 시스템은 단일 통합 발음 사전을 사용하여 여러 다국어 발음 변이를 효과적으로 모델링한다.
- 후어휘 신경망은 개인의 음성 데이터로 재학습함으로써 화자별 발음 패턴을 효과적으로 학습한다.
- 후어휘 처리에 신경망을 사용함으로써 시스템은 높은 정확도로 다국어 및 개인별 변이에 일반화할 수 있다.
- 후어휘 모듈을 각 화자별로 재학습함으로써 고정 규칙 기반 시스템에 비해 훨씬 더 자연스러운 합성 음성이 생성된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.