Skip to main content
QUICK REVIEW

[논문 리뷰] Text-Free Prosody-Aware Generative Spoken Language Modeling

Eugene Kharitonov, Ann Lee|arXiv (Cornell University)|2021. 09. 07.
Speech Recognition and Synthesis참고 문헌 42인용 수 16
한 줄 요약

이 논문은 자기지도 학습 단위와 양자화된 프로소디 특징(F0 및 지속 시간)을 사용하여 음소적 내용과 프로소디를 동시에 모델링하는 텍스트 없는 생성형 구어 언어 모델인 pGSLM을 제안한다. 다중 스트림 트랜스포머 언어 모델과 HiFi-GAN 음성 합성기(보코더)를 활용하여 pGSLM은 구어 프롬프트로부터 일관되고 표현력 있으며 프로소디적으로 일관된 음성을 생성하며, 내용 및 프로소디 모델링 측면에서 텍스트 없는 기존 모델들을 능가한다. 특히, 양자화된 프로소디 스트림은 생성의 다양성과 일관성 측면에서 뛰어난 성능을 발휘한다.

ABSTRACT

Speech pre-training has primarily demonstrated efficacy on classification tasks, while its capability of generating novel speech, similar to how GPT-2 can generate coherent paragraphs, has barely been explored. Generative Spoken Language Modeling (GSLM) \cite{Lakhotia2021} is the only prior work addressing the generative aspects of speech pre-training, which replaces text with discovered phone-like units for language modeling and shows the ability to generate meaningful novel sentences. Unfortunately, despite eliminating the need of text, the units used in GSLM discard most of the prosodic information. Hence, GSLM fails to leverage prosody for better comprehension, and does not generate expressive speech. In this work, we present a prosody-aware generative spoken language model (pGSLM). It is composed of a multi-stream transformer language model (MS-TLM) of speech, represented as discovered unit and prosodic feature streams, and an adapted HiFi-GAN model converting MS-TLM outputs to waveforms. We devise a series of metrics for prosody modeling and generation, and re-use metrics from GSLM for content modeling. Experimental results show that the pGSLM can utilize prosody to improve both prosody and content modeling, and also generate natural, meaningful, and coherent speech given a spoken prompt. Audio samples can be found at https://speechbot.github.io/pgslm. Codes and models are available at https://github.com/pytorch/fairseq/tree/main/examples/textless_nlp/pgslm.

연구 동기 및 목표

  • 기존의 텍스트 없는 접근 방식에서 손실된 프로소디 정보를 유지하는 텍스트 없는 생성형 구어 언어 모델을 개발하는 것.
  • 음소적 내용과 프로소디를 함께 모델링하는 것이 음성 생성 품질과 일관성에 미치는 영향을 조사하는 것.
  • 이산적 표현과 연속적 표현 간의 프로소디 표현 방식이 생성의 다양성과 일관성에 미치는 영향을 평가하는 것.
  • 텍스트 감독이 없는 상황에서 프로소디 모델링 및 생성을 위한 새로운 평가 지표를 설계하고 검증하는 것.
  • 주어진 프롬프트와 동일한 의미적 일관성과 프로소디 일관성을 유지하는 조건부 음성 생성을 가능하게 하는 것.

제안 방법

  • 모델는 자기지도 학습 단위와 양자화된 프로소디 특징(F0 및 지속 시간)을 별도의 스트림으로 처리하는 다중 스트림 트랜스포머 언어 모델(MS-TLM)을 사용한다.
  • 프로소디 특징은 벡터 양자화를 통해 이산 토큰으로 표현되어, 연속적 표현에 비해 다중 모odal 분포를 더 잘 모델링할 수 있다.
  • MS-TLM는 이전 시퀀스를 기반으로 다음 단위와 프로소디 토큰을 예측하도록 자동회귀적으로 훈련되며, 이산 토큰에 대해서는 교차 엔트로피 손실, 연속 값에 대해서는 L1 손실을 사용한다.
  • 미세조정된 HiFi-GAN 보코더는 생성된 단위 및 프로소디 시퀀스를 고해상도 웨이브포맷으로 변환한다.
  • 모델 평가는 내용 평가 지표(예: BLEU)와 새로 제안한 프로소디 평가 지표(지속 시간 및 F0에 대한 MAE, 일관성 및 표현력에 기반한 상관계수 지표)의 조합을 통해 수행된다.
  • 제거 실험에서는 프로소디 입력 유무 및 이산적/연속적 프로소디 표현 방식을 비교하여 각 설계 선택의 영향을 분리 분석한다.

실험 결과

연구 질문

  • RQ1음소적 내용과 프로소디를 함께 모델링하면 텍스트 없는 구어 언어 생성에서 내용 및 프로소디 모델링이 향상되는가?
  • RQ2프로소디에 대해 이산적 표현을 사용할 경우 연속적 표현에 비해 더 높은 생성 다양성과 일관성 달성 가능성이 있는가?
  • RQ3입력에 프로소디를 포함시키면 자동회귀 생성 과정에서 프로소디 일관성을 유지하는 데 모델의 능력이 어떻게 영향을 받는가?
  • RQ4프로소디 인식 모델링이 입력 프롬프트에 비해 생성 음성의 일관성과 표현력 향상에 얼마나 기여하는가?
  • RQ5제안된 모델은 텍스트 감독 없이도 자연스럽고 의미가 있으며 일관된 음성을 생성할 수 있는가?

주요 결과

  • 프로소디 입력이 있는 모델은 계속 생성 작업에서 지속 시간(MAE: 0.536 vs. 0.542)과 F0(MAE: 0.077 vs. 0.096)에 대해 유의미하게 낮은 MAE를 기록하여 프로소디 모델링 향상을 입증한다.
  • 이산 프로소디 모델(행 12)은 연속 모델보다 F0 값의 표준편차가 2배 높아, 더 높은 프로소디 다양성을 나타낸다.
  • 프로소디 입력이 있는 이산 프로소디 모델은 인간 평가에서 가장 높은 MOS(4.21)와 M-MOS(3.85)를 기록하여 다른 변형들보다 뛰어난 성능을 보였다.
  • 프로소디 일관성에 대한 상관계수 지표는 프로소디 입력이 있을 경우 크게 향상되었으며, 지속 시간의 상관계수는 0.176에서 0.344로, F0는 0.093에서 0.494로 상승했다.
  • 프로소디 입력이 있는 모델의 단어 수준 BLEU 점수는 더 높았다(예: 행 12는 12.8, 행 10은 12.5), 이는 내용 모델링 향상을 시사한다.
  • 이산 프로소디와 프로소디 입력을 모두 적용한 모델가 인간 평가 및 지표 분석을 통해 표현력, 일관성, 일관성의 최적의 균형을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.