[논문 리뷰] Improving Accent Conversion with Reference Encoder and End-To-End Text-To-Speech
이 논문은 병렬 데이터나 추론 시에 원어민 음성 자료가 필요 없이도 음성 품질과 원어민 발음 유사도를 크게 향상시키는 엔드 투 엔드 발음 변환 시스템을 제안한다. 이는 사전 훈련된 텍스트-to-음성(TTS) 모델을 활용해 원어민 기준 음성을 생성하고, 참조 인코더를 통해 유창성 및 억양 특징을 강화함으로써 달성된다. 이 방법은 평가 점수(MOS)에서 30% 상대적 향상과 원어민 발음 선호도에서 68% 상대적 향상을 기록한다.
Accent conversion (AC) transforms a non-native speaker's accent into a native accent while maintaining the speaker's voice timbre. In this paper, we propose approaches to improving accent conversion applicability, as well as quality. First of all, we assume no reference speech is available at the conversion stage, and hence we employ an end-to-end text-to-speech system that is trained on native speech to generate native reference speech. To improve the quality and accent of the converted speech, we introduce reference encoders which make us capable of utilizing multi-source information. This is motivated by acoustic features extracted from native reference and linguistic information, which are complementary to conventional phonetic posteriorgrams (PPGs), so they can be concatenated as features to improve a baseline system based only on PPGs. Moreover, we optimize model architecture using GMM-based attention instead of windowed attention to elevate synthesized performance. Experimental results indicate when the proposed techniques are applied the integrated system significantly raises the scores of acoustic quality (30$\\%$ relative increase in mean opinion score) and native accent (68$\\%$ relative preference) while retaining the voice identity of the non-native speaker.
연구 동기 및 목표
- 추론 시 병렬 데이터나 원어민 기준 음성 자료가 필요 없이 발음 변환을 가능하게 한다.
- 유창성 및 언어적 특징을 통합하여 비원어민 음성의 음성 품질과 원어민 발음 유사도를 향상시킨다.
- PPG 중심의 기존 시스템의 한계를 참조 인코더에서 유도된 보완 정보를 통합함으로써 해결한다.
- GMM 어텐션과 CBHG 인코더와 같은 아키텍처 개선을 통해 모델의 안정성과 표현력을 향상시킨다.
- 학습자에게 고해상도의 원어민 발음 음성을 생성함으로써 컴퓨터 지원 발음 훈련(CAPT)을 지원한다.
제안 방법
- 1시간 분량의 원어민 음성 데이터로 훈련된 엔드 투 엔드 TTS 시스템을 활용해 비원어민 문장에 대한 기준 음성을 생성함으로써 추론 시 별도의 원어민 음성 자료 확보가 불필요해진다.
- 참조 인코더—딥 네ural 네트워크—를 활용해 생성된 원어민 기준 음성에서 유창성 및 표현적 특징을 추출하고, 이를 음소 후행확률그림자(PPG)와 연결한다.
- PPG(음소적 내용)와 참조 인코더 출력물(유창성 및 억양)을 결합하는 다중 소스 특징 융합 전략을 도입하여 입력 표현의 풍부함을 향상시킨다.
- 표준 윈도우형 어텐션 대신 GMM 기반 어텐션을 도입하여 시퀀스의 장거리 의존성 모델링과 정렬 안정성을 향상시킨다.
- Tacotron2 인코더를 CBHG 인코더로 교체하여 특징 표현력과 모델의 표현력을 향상시킨다.
- 예측된 멜-스펙트로그램에서 실시간으로 고해상도 웨이브폼을 생성하기 위해 WaveRNN 보코다를 활용한다.
실험 결과
연구 질문
- RQ1TTS 기반 기준 음성 생성 시스템이 병렬 데이터나 원어민 기준 음성 자료의 필요성을 효과적으로 대체할 수 있는가?
- RQ2PPG와 참조 인코더 출력물을 융합할 경우 발음 변환 품질과 유창성이 어떻게 향상되는가?
- RQ3GMM 어텐션과 CBHG 인코더와 같은 아키텍처 개선이 모델 안정성과 음성 품질 향상에 어느 정도 기여하는가?
- RQ4제안된 시스템은 비원어민 발음의 감소를 극복하면서도 화자 신원을 유지할 수 있는가?
- RQ5MOS, 선호도, 음성 유사도와 같은 목적적 및 주관적 지표에서 다양한 시스템 버전 간의 성능 비교는 어떻게 이루어지는가?
주요 결과
- 제안된 시스템은 평균 평가 점수(MOS)에서 30% 상대적 향상을 기록하여 기준 모델 대비 음성 품질 향상이 뚜렷하게 나타났다.
- 원어민 발음에 대한 선호도에서 68% 상대적 향상을 보이며 자연스럽고 원어민처럼 들리는 음성 생성 능력이 뛰어나다는 것을 입증했다.
- PPG와 음소 시퀀스를 모두 참조 인코더에 입력하는 System 3가 가장 높은 MOS 점수를 기록했으며, PPG 또는 멜-스펙트로그램에만 의존하는 시스템보다 뛰어난 성능을 보였다.
- 모든 시스템에서 화자 신원이 유지되었으며, 청취자들이 System 1, 2, 3의 신뢰도와 선호도를 유사하게 평가함으로써 화자 정체성 유지 능력이 뛰어나다는 것을 확인했다.
- 발음 유사도 테스트 결과, 참조 인코더를 사용한 시스템들(Sys 2 및 3)이 기준 모델보다 유의미하게 뛰어난 성능을 보였으며, 특히 System 3는 3.58/5점의 평점을 기록했고, 원본 ZHAA 녹음본의 1.81점과 비교해 뚜렷한 향상을 보였다.
- 참조 인코더 통합과 아키텍처 최적화(GMM 어텐션, CBHG)가 상호 보완적이며 성능 향상의 핵심 요인임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.