[논문 리뷰] Incremental Text-to-Speech Synthesis with Prefix-to-Prefix Framework
이 논문은 입력 텍스트가 점진적으로 도착하는 상황에서 실시간으로 음성 생성을 수행하면서도 오디오 조각을 동시에 재생함으로써 O(1) 지연을 달성하는 프리픽스-투-프리픽스 프레임워크를 제안한다. 이는 전체 문장 TTS와 비교해 뛰어난 자연스러움을 유지하면서도 저지연을 실현한다. 이 방법은 1~2단어의 룩어헤드만으로도 저지연, 연속적인 오디오 생성이 가능하게 하여 대화 시스템 및 보조 기술과 같은 실시간 응용 분야에 적합하다.
Text-to-speech synthesis (TTS) has witnessed rapid progress in recent years, where neural methods became capable of producing audios with high naturalness. However, these efforts still suffer from two types of latencies: (a) the {\em computational latency} (synthesizing time), which grows linearly with the sentence length even with parallel approaches, and (b) the {\em input latency} in scenarios where the input text is incrementally generated (such as in simultaneous translation, dialog generation, and assistive technologies). To reduce these latencies, we devise the first neural incremental TTS approach based on the recently proposed prefix-to-prefix framework. We synthesize speech in an online fashion, playing a segment of audio while generating the next, resulting in an $O(1)$ rather than $O(n)$ latency.
연구 동기 및 목표
- 입력 텍스트가 점진적으로 도착하는 상황에서 신경 TTS 시스템의 계산 및 입력 지연을 줄이기.
- 기존 모델을 재학습하지 않고도 실시간으로 저지연 TTS 합성을 가능하게 하며, 고해상도 음성 자연스러움을 유지하기.
- 오디오 생성 속도가 재생 속도를 따라가도록 보장함으로써 원활하고 연속적인 오디오 재생을 지원하기.
- CPU 및 GPU에서의 효율적인 추론을 통해 현장 내 TTS의 실용적 구현 가능성을 입증하기.
제안 방법
- 동시 번역에서 유래한 프리픽스-투-프리픽스 추론 프레임워크를 신경 TTS에 적용하여 점진적 생성을 가능하게 한다.
- 단조적 어텐션 메커니즘을 사용해 입력 의존성을 국소화함으로써 재학습 없이도 안정적이고 안전한 점진적 추론을 보장한다.
- 루크아헤드-k 정책을 구현하여 음성 생성이 입력보다 k개 단어(=1 또는 2) 뒤처지게 하여 고품질 합성을 위한 충분한 맥락을 확보한다.
- 텍스트-음소, 음소-스펙트로그램, 스펙트로그램-웨이브로 분해된 모듈식 스테이지로 TTS 파이프라인을 구성하여 병렬 처리가 가능하도록 한다.
- 음성 조각이 생성되는 즉시 재생을 시작함으로써 종단 간 지연을 최소화하는 온라인 오디오 재생을 구현한다.
- 시간 균형 분석을 통해 오디오 생성이 다음 청크 재생 시작 전에 항상 완료됨을 확인함으로써 지속적인 스트리밍 재생이 가능함을 검증한다.
실험 결과
연구 질문
- RQ1프리픽스-투-프리픽스 프레임워크는 재학습 없이도 신경 TTS에 효과적으로 적용되어 저지연 합성을 달성할 수 있는가?
- RQ2제안된 점진적 TTS 방법은 전체 문장 TTS와 비교해 음성 자연스러움과 지연 측면에서 어떻게 성능을 내는가?
- RQ3다양한 문장 길이와 언어에서 시스템은 중단 없이 연속적인 오디오 재생을 유지할 수 있는가?
- RQ4루크아헤드 길이(k)는 점진적 TTS의 음성 품질과 지연에 어떤 영향을 미치는가?
- RQ5이 방법은 현장 내 배포를 위해 CPU 및 GPU에서 효율적인 추론을 지원할 수 있는가?
주요 결과
- 제안된 점진적 TTS는 문장 길이에 관계없이 영어 및 중국어 모두에서 합성 시간이 0.3초 이내로 O(1) 지연을 달성했으며, 전체 문장 TTS의 O(n) 지연과 대비된다.
- MOS로 측정한 음성 품질은 전체 문장 TTS와 유사하며, 점진적 생성 방식임에도 불구하고 유의미한 품질 저하가 없음을 확인했다.
- 시간 균형 분석 결과, 오디오 생성이 다음 청크 재생 시작 전에 항상 완료되어 중단 없는 연속 재생이 가능함을 확인했다.
- 시니어링 실험에서 점진적 TTS는 영어 및 중국어 모두에서 지연이 2.5초 이내로 일정하게 유지되었으며, 전체 문장 TTS는 문장 길이에 비례해 지연이 선형 증가함을 확인했다.
- 이 방법은 CPU 및 GPU 모두에서 효율적인 추론을 지원하여 현장 내 TTS 구현 가능성을 입증했다.
- 루크아헤드-1 및 룩어헤드-2 정책이 기준 방법보다 지연과 음성 품질 측면에서 뛰어나, 룩어헤드 맥락의 중요성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.