[논문 리뷰] An Investigation of the Relation Between Grapheme Embeddings and Pronunciation for Tacotron-based Systems
이 논문은 프랑스어의 철자표기법을 사용해 훈련된 Tacotron 모델이 훈련 중에 음소 유사 표현을 임베딩 내에 암묵적으로 학습하는 방식을 조사한다. 이는 훈련 중 음성학적 지도가 없음에도 불구하고 이러한 철자표기 임베딩이 발음 정보를 암묵적으로 포함하고 있음을 입증한다. 주요 발견은 이러한 임베딩을 사용해 철자에서 음소로의 변환(G2P)과 합성 음성에서의 음소 제어가 가능하며, 이는 철자 기반 시스템에서도 음소 조작이 가능하게 한다.
End-to-end models, particularly Tacotron-based ones, are currently a popular solution for text-to-speech synthesis. They allow the production of high-quality synthesized speech with little to no text preprocessing. Indeed, they can be trained using either graphemes or phonemes as input directly. However, in the case of grapheme inputs, little is known concerning the relation between the underlying representations learned by the model and word pronunciations. This work investigates this relation in the case of a Tacotron model trained on French graphemes. Our analysis shows that grapheme embeddings are related to phoneme information despite no such information being present during training. Thanks to this property, we show that grapheme embeddings learned by Tacotron models can be useful for tasks such as grapheme-to-phoneme conversion and control of the pronunciation in synthetic speech.
연구 동기 및 목표
- 음성학적 지도 없이도 철자표기법으로 훈련된 Tacotron 모델이 음소와 관련된 표현을 학습하는지 조사하기 위해.
- 저자원 환경에서 철자표기법 임베딩의 유용성을 철자에서 음소로의 변환(G2P)에 평가하기 위해.
- 학습된 임베딩을 조작함으로써 철자 기반 TTS 시스템에서 음소 제어가 가능한지 탐색하기 위해.
- 고품질의 프랑스어 데이터셋에서 철자 기반과 음소 기반 Tacotron 모델의 성능을 비교하기 위해.
- 철자 일관성이 학습된 임베딩의 음소적 관련성에 어떤 영향을 미치는지 평가하기 위해.
제안 방법
- 일괄적 철자표기법을 입력으로 사용하여 정제된 프랑스어 데이터셋을 기반으로 Tacotron 기반 모델을 훈련시켰으며, 시퀀스 모델링을 향상시키기 위해 CBHG 모듈과 자기주의 어텐션 블록을 사용하였다.
- 변동 길이의 철자표기 시퀀스를 처리하고 N-그램 유사 패턴에 대한 필터뱅크 역할을 하는 CBHG 모듈의 출력에서 임베딩을 추출하였다.
- 정렬된 데이터가 필요 없이 종단 간 음소 예측을 가능하게 하기 위해, CTC 손실을 사용한 얕은 LSTM 모델을 임베딩에서 음소를 예측하도록 훈련시켰다.
- 테스트 세트에서의 음소 오류율(PER)을 측정하여, 원시 철자표기법 대비 임베딩을 사용한 G2P 성능을 평가하였다.
- 합성 음성에서 발음을 제어하기 위해 문장 간의 문맥적 철자표기법 임베딩을 교환하는 프로토타입 실험을 수행하였다.
- Tacotron 모델이 예측한 멜스펙트로그램에서 음성을 생성하기 위해 WaveRNN 버커를 사용하였다.
실험 결과
연구 질문
- RQ1음성학적 지도 없이 훈련된 Tacotron 모델의 철자표기법 임베딩이 의미 있는 음소 정보를 포함하고 있는가?
- RQ2특히 저자원 환경에서 철자표기법 임베딩이 철자에서 음소로의 변환에 효과적으로 활용될 수 있는가?
- RQ3학습된 임베딩을 조작함으로써 철자 기반 TTS 시스템에서 음소 제어가 가능한가?
- RQ4고품질의 프랑스어 데이터셋에서 철자 기반 Tacotron의 성능은 음소 기반 Tacotron과 어떻게 비교되는가?
- RQ5철자 일관성이 학습된 철자표기법 임베딩의 음소적 관련성에 어떤 영향을 미치는가?
주요 결과
- 정제된 프랑스어 데이터셋에서 철자 기반 Tacotron 모델은 발음과 전체 음성 품질 측면에서 음소 기반 모델과 유사한 성능을 보였다.
- G2P 변환에 임베딩을 사용했을 때, 훈련 세트에서 평균 음소 오류율(PER)은 12.8%를 기록했으며, 원시 철자표기법으로 직접 훈련된 모델(19.3% PER)보다 우수한 성능을 보였다.
- 작은 개발 세트(400문장)에서도 G2P 모델이 임베딩을 사용할 경우 원시 철자표기법 모델보다 우수한 성능(16.4% vs. 30.2% PER)을 보였으며, 이는 임베딩이 데이터 부족 상황에서도 더 강건함을 시사한다.
- 유사한 맥락에서 'b'와 'm' 철자표기법의 임베딩을 교환함으로써 음성 합성에서 /m/이 /b/ 대신 정확히 생성되는 것을 성공적으로 시연하였다.
- 맥락의 차이가 클 경우 청취자들이 의도한 음소를 신뢰성 있게 식별하지 못했으며, 이는 임베딩 기반 제어의 맥락 의존성을 시사한다.
- 결과는 Tacotron의 CBHG 모듈이 N-그램 기반 G2P 규칙과 유사한 통계적 패턴을 암묵적으로 학습함으로써, 음소 기반 지도 없이도 철자표기법에서 음소 표현 학습이 가능하다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.