[논문 리뷰] Conversational End-to-End TTS for Voice Agent
이 논문은 새로운 자연스러운 대화형 음성 코퍼스와 이중 인코더 아키텍처를 사용하여 대화 맥락 인식형 엔드 투 엔드 TTS 시스템을 제안한다. 보조 인코더를 통해 의미/구문 특징을 통합하고 대화 기록을 위한 대화 맥락 인코더를 도입함으로써, 모델은 더 자연스러운 유창성과 채움말, 반복 등의 자연스러운 행동을 표현하며 기준 모델보다 0.62 CMOS 및 59.0%의 선호도 향상을 달성한다.
End-to-end neural TTS has achieved superior performance on reading style speech synthesis. However, it's still a challenge to build a high-quality conversational TTS due to the limitations of the corpus and modeling capability. This study aims at building a conversational TTS for a voice agent under sequence to sequence modeling framework. We firstly construct a spontaneous conversational speech corpus well designed for the voice agent with a new recording scheme ensuring both recording quality and conversational speaking style. Secondly, we propose a conversation context-aware end-to-end TTS approach which has an auxiliary encoder and a conversational context encoder to reinforce the information about the current utterance and its context in a conversation as well. Experimental results show that the proposed methods produce more natural prosody in accordance with the conversational context, with significant preference gains at both utterance-level and conversation-level. Moreover, we find that the model has the ability to express some spontaneous behaviors, like fillers and repeated words, which makes the conversational speaking style more realistic.
연구 동기 및 목표
- 음성 에이전트를 위한 고품질의 자연스러운 대화형 음성 생성 문제를 해결하기 위해.
- 고음질과 진정성 있는 대화 스타일을 동시에 확보하는 새로운 녹음 기법을 개발하기 위해.
- 대화 액트나 복잡한 레이블의 수동 표기 없이 맥락 의존적 유창성 모델링이 가능한 엔드 투 엔드 TTS 모델을 설계하기 위해.
- TTS 시스템이 채움말, 반복과 같은 자연스러운 언어 행동을 명시적 지시 없이 자연스럽게 표현할 수 있도록 하기 위해.
제안 방법
- 3단계 연기 녹음 기법을 사용함: 장면 및 대화 기획, 연기 기반 녹음, 텍스트 변환을 통해 고품질의 자연스러운 대화 코퍼스를 구축함.
- BERT 임베딩과 통계적 문법 특징에서 깊이 있는 의미 및 문법 특징을 추출하기 위해 보조 인코더를 도입하여 유창성 모델링을 향상시킴.
- 이전 대화 턴의 BERT 임베딩을 사용하여 이전 발화 기록을 인코딩하는 대화 맥락 인코더를 설계함으로써 맥락 인식 유창성 생성을 가능하게 함.
- Transformer 기반 디코더를 사용하는 시퀀스 투 시퀀스 프레임워크를 활용하며, 단일 GPU에서 Adam 옵timizer와 학습률 감소 기법을 사용해 훈련함.
- 엔드 투 엔드 TTS 시스템은 음성 생성을 동시에 최적화하면서도, 훈련 데이터를 통해 자연스럽게 자연스러운 언어 행동을 암묵적으로 학습함.
실험 결과
연구 질문
- RQ1새로운 녹음 기법이 음질과 자연스러운 말하기 스타일을 모두 유지하는 고품질의 대화형 TTS 코퍼스를 생성할 수 있는가?
- RQ2보조 및 맥락 인코더를 갖춘 엔드 투 엔드 TTS 모델이 대화 맥락에 부합하는 더 자연스러운 유창성을 생성할 수 있는가?
- RQ3모델이 명시적 레이블 없이도 채움말, 반복과 같은 자연스러운 언어 행동을 학습할 수 있는가?
- RQ4보조 인코더와 맥락 인코더가 각각 및 함께 발화 수준 및 대화 수준의 유창성 향상에 어떻게 기여하는가?
주요 결과
- 제안된 모델은 기준 모델 대비 0.62 CMOS 향상과 59.0%의 선호도 향상을 기록하며 맥락 인식 유창성에서 뛰어난 자연스러움을 입증함.
- 보조 인코더만으로도 발화 수준에서 0.22 CMOS 향상과 42.9%의 선호도 향상을 기록하여 의미 및 문법 모델링 향상으로 인한 유창성 향상이 확인됨.
- 대화 맥락 인코더의 추가로 발화 수준에서 추가로 0.18 CMOS 향상과 42.1%의 선호도 향상이 이루어져 성능 향상이 이루어짐.
- 모델은 채움말, 반복어 등의 자연스러운 언어 행동을 명시적 지도 없이도 성공적으로 학습하여 대화 음성의 현실감을 향상시킴.
- 두 인코더의 조합은 발화 수준에서 0.39 CMOS 향상과 57.0%의 선호도 향상을 기록하며 맥락 모델링에서 상호보완적 이점이 있음을 보여줌.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.