[논문 리뷰] Maximizing Mutual Information for Tacotron
이 논문은 자동회귀 모델에서 국소 정보 선호 현상으로 인한 발화 오류율을 줄이기 위해 타코트론에서 텍스트 조건과 예측 음성 특징 간 상호정보량(MMI)을 최대화하는 방법을 제안한다. 보조 CTC 인식기로 텍스트-음성 간 의존성을 강화함으로써, 종단간 훈련을 해체하지 않고 오류를 감소시키며, DFR 0.2일 때 LJSpeech에서 발화 오류율이 최대 67% 감소한다.
End-to-end speech synthesis methods already achieve close-to-human quality performance. However compared to HMM-based and NN-based frame-to-frame regression methods, they are prone to some synthesis errors, such as missing or repeating words and incomplete synthesis. We attribute the comparatively high utterance error rate to the local information preference of conditional autoregressive models, and the ill-posed training objective of the model, which describes mostly the training status of the autoregressive module, but rarely that of the condition module. Inspired by InfoGAN, we propose to maximize the mutual information between the text condition and the predicted acoustic features to strengthen the dependency between them for CAR speech synthesis model, which would alleviate the local information preference issue and reduce the utterance error rate. The training objective of maximizing mutual information can be considered as a metric of the dependency between the autoregressive module and the condition module. Experiment results show that our method can reduce the utterance error rate.
연구 동기 및 목표
- 자동회귀 아키텍처에서 발생하는 국소 정보 선호 현상으로 인해 발생하는 종단간 음성 합성 모델(예: 타코트론)의 높은 발화 오류율을 해결하기 위해.
- 조건 모듈과 자동회귀 모듈 간 의존성을 잘 반영하지 못하는 잘못 정의된 훈련 목표를 완화하기 위해.
- 상호정보량 최대화를 통해 입력 텍스트와 예측 음성 특징 간 의존성을 강화하기 위해.
- 종단간 훈련을 해체하지 않고 추론 시 모델의 신뢰성을 향상시키기 위해.
- 재구성 오차만으로는 부족한 언어적 내용 정렬을 더 잘 반영하는 훈련 목표를 제공하기 위해.
제안 방법
- 텍스트 조건과 예측 음성 특징 간 상호정보량을 추정하기 위해 보조 CTC 인식기를 도입한다.
- 동일한 은닉 상태를 타코트론 디코더와 공유하여 CTC 인식기를 훈련시켜 텍스트와 음성 특징 간 정렬을 예측하도록 한다.
- 재구성 오차를 최소화하고 대조 학습을 통해 상호정보량을 최대화하는 통합 목표함수를 최적화하여 주 타코트론 모델을 훈련시킨다.
- 노출 편향을 줄이기 위해 추론 조건을 시뮬레이션하기 위해 훈련 중에 프레임 제거 비율(DFR) 전략을 적용한다.
- CTC 입력 전에 텍스트와 음성 정보를 혼합하기 위해 선형 변환 이전에 추가적인 LSTM 레이어를 갖는 공유 인코더를 사용한다.
- 상호정보량 가중치 초모델 파라미터 λ = 1.0으로 설정하고, 200만 훈련 스텝에서 평가한다.
실험 결과
연구 질문
- RQ1텍스트와 음성 특징 간 상호정보량을 최대화하면 타코트론에서 발화 오류율을 줄일 수 있는가?
- RQ2상호정보량 최대화가 자동회귀 음성 합성 모델에서 국소 정보 선호 현상을 완화하는가?
- RQ3제안된 방법은 종단간 훈련을 해체하지 않고 조건과 출력 간 의존성을 향상시킬 수 있는가?
- RQ4상호정보량 목표의 추가로 인해 청취 품질이나 웨이브폼 정밀도가 떨어지는가?
- RQ5상호정보량 최대화와 DFR 훈련의 조합이 일반화 및 오류 감소에 어떤 영향을 미치는가?
주요 결과
- RF 2이고 DFR 없이 사용할 경우 LJSpeech에서 발화 오류율(UER)이 16%에서 10%로 감소하여 상대적 개선률이 37.5%였다.
- DFR 0.2일 때 MMI를 사용하면 UER가 5%로 떨어져 기준 모델 대비 67%의 상대적 감소를 보였다.
- 더 큰 db-CSMSC 코퍼스에서 동일한 설정으로 UER가 17%에서 5%로 감소하여 강력한 일반화 능력을 보였다.
- 손실 곡선 분석 결과, MMI 없이 훈련할 경우 검증 재구성 오차와 훈련 재구성 오차 간 격차가 더 일찍 커지며 비언어적 세부 정보에 과적합됨을 나타냈다.
- MMI를 적용한 모델는 기준 모델과 유사한 평균 관점 점수(MOS)를 유지했다(3.84 vs. 3.83), 즉 청취 품질에 악영향을 주지 않았다.
- MMI와 DFR 0.2의 조합이 가장 높은 MOS(3.92)를 기록하여 안정성과 품질 향상을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.