[논문 리뷰] VoiceLoop: Voice Fitting and Synthesis via a Phonological Loop
VoiceLoop는 음성 샘플에 대한 음소 정렬이나 언어적 특징 없이도 제약 없는 실외 음성 샘플에서 자연스러운 음성 합성을 구현하는 혁신적인 신경 음성합성 시스템을 소개한다. 장기적 의존성을 유지하기 위해 음성 순환망의 영감을 받은 공유되고 이동하는 버퍼 메모리 구조를 사용하며, 이는 소량의 데이터로도 강력한 음성 맞춤화 및 합성을 가능하게 하며, 새로운 화자에 대한 후기 학습 적응도 단 몇 개의 오디오 샘플로 가능하다.
We present a new neural text to speech (TTS) method that is able to transform text to speech in voices that are sampled in the wild. Unlike other systems, our solution is able to deal with unconstrained voice samples and without requiring aligned phonemes or linguistic features. The network architecture is simpler than those in the existing literature and is based on a novel shifting buffer working memory. The same buffer is used for estimating the attention, computing the output audio, and for updating the buffer itself. The input sentence is encoded using a context-free lookup table that contains one entry per character or phoneme. The speakers are similarly represented by a short vector that can also be fitted to new identities, even with only a few samples. Variability in the generated speech is achieved by priming the buffer prior to generating the audio. Experimental results on several datasets demonstrate convincing capabilities, making TTS accessible to a wider range of applications. In order to promote reproducibility, we release our source code and models.
연구 동기 및 목표
- 유튜브 연설과 같은 배경 소음, 박수, 열악한 음질을 포함한 제약 없는 실생활 오디오 샘플을 사용해 음성합성 시스템을 구현하는 것.
- TTS 학습 및 추론 과정에서 음소-음성 데이터의 정렬 또는 명시적 언어적 특징의 필요성을 제거하는 것.
- 단 몇 개의 짧은 오디오 클립만으로도 새로운 화자에 대해 후기 학습을 통해 음성 맞춤화를 가능하게 하는 것.
- 모바일 기기에서 실시간 추론에 적합한 경량이고 효율적인 아키텍처 개발
제안 방법
- 동적 워킹 메모리로 사용되는 이동 버퍼 메모리 행렬 S ∈ ℝ^d×k 를 사용하며, 각 타임스텝에서 각 열이 오른쪽으로 이동하고, 새로운 표현 벡터 u 가 앞쪽에 삽입된다.
- 표현 벡터 u 는 화자 임베딩, 현재 어텐션 컨텍스트, 이전 출력, 전체 버퍼 상태를 입력으로 사용하는 얕은 완전 연결 신경망을 통해 계산된다.
- 어텐션 메커니즘은 그레이브스의 단조적 어텐션을 사용하여 음소 임베딩에서 컨텍스트 벡터를 계산하며, 순차적이고 왼쪽에서 오른쪽으로의 처리 흐름을 보장한다.
- 출력 오디오는 별도의 얕은 네트워크를 통해 생성되며, 버퍼 상태와 화자 임베딩를 입력으로 받아 직접적이고 개인화된 합성을 가능하게 한다.
- 화자 신원은 학습된 임베딩 벡터로 모델링되며, 소량의 데이터로도 후기 학습 시에 새로운 신원에 맞게 미세조정하거나 적합화할 수 있다.
- 프라밍을 통해 이전 단어의 컨텍스트 벡터로 버퍼를 초기화함으로써 다양한 억양을 생성할 수 있으며, 동일한 텍스트 입력에서 여러 가지 다양한 어조 변화를 가능하게 한다.
실험 결과
연구 질문
- RQ1음소 정렬이나 언어적 특징이 없는 제약 없는 실외 음성 샘플에서 고품질의 음성합성을 달성할 수 있는 신경 TTS 시스템이 존재하는가?
- RQ2RNN과 비교해 볼 때, 공유되고 이동하는 버퍼 메모리 메커니즘이 음성합성에서 장기적 의존성을 모델링하는 데 얼마나 효과적인가?
- RQ3재학습 없이도 단 몇 개의 짧은 오디오 클립으로만 새로운 화자에 대해 일반화할 수 있는가?
- RQ4음성 순환망 영감을 받은 메모리 아키텍처가 소음과 비이상적인 녹음 조건에 대해 얼마나 강건한가?
- RQ5버퍼를 다양한 단어로 프라밍하면 동일한 텍스트 입력에서 다양한 어조 변화(예: 다양한 억양)를 생성할 수 있는가?
주요 결과
- VoiceLoop는 실제 유튜브 데이터셋에서 평균 평가 점수(MOS)가 2.97 ± 1.03를 기록하여, 소음이 많고 정렬되지 않은 학습 데이터에도 불구하고 청취자적으로 수용 가능한 음성 품질을 입증했다.
- 합성 음성에서 화자 식별 네트워크의 상위-1 정확도가 95.81%에 도달하여, 합성된 음성이 목표 화자의 신원을 정확히 반영하고 있음을 시사한다.
- 기준 모델인 Char2Wav과 달리, 클래핑이나 웃음소리와 같은 배경 소음을 합성에서 피했으며, 이는 모델이 이러한 잡음을 반복하지 않았음을 의미한다.
- 다른 단어들(예: 'I', 'had', 'must', 'bye')로 버퍼를 프라밍함으로써 F0와 음소 지속 시간의 변화를 포함한 고유한 어조 패턴이 생성되었으며, 스펙트로그램 및 F0 분석을 통해 확인되었다.
- 시스템은 CPU에서 실시간 추론 속도가 2.7배 이상을 기록하여, 모바일 배포에 적합한 높은 계산 효율성을 입증했다.
- 단 몇 초의 오디오로도 후기 학습 시 화자 맞춤화가 효과적으로 이루어졌으며, 소량의 데이터로도 제로샷 음성 클로닝이 가능했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.