[论文解读] Text-Free Prosody-Aware Generative Spoken Language Modeling
本文提出 pGSLM,一种无需文本的生成式口语语言模型,通过自监督单元和量化后的韵律特征(F0 和时长)联合建模语音内容与韵律。通过采用多流 Transformer 语言模型和 HiFi-GAN 语音合成器,pGSLM 能够从口语提示生成连贯、富有表现力且韵律一致的语音,在内容和韵律建模方面均优于无文本基线模型,其中量化后的韵律流在生成的多样性与一致性方面表现更优。
Speech pre-training has primarily demonstrated efficacy on classification tasks, while its capability of generating novel speech, similar to how GPT-2 can generate coherent paragraphs, has barely been explored. Generative Spoken Language Modeling (GSLM) \cite{Lakhotia2021} is the only prior work addressing the generative aspects of speech pre-training, which replaces text with discovered phone-like units for language modeling and shows the ability to generate meaningful novel sentences. Unfortunately, despite eliminating the need of text, the units used in GSLM discard most of the prosodic information. Hence, GSLM fails to leverage prosody for better comprehension, and does not generate expressive speech. In this work, we present a prosody-aware generative spoken language model (pGSLM). It is composed of a multi-stream transformer language model (MS-TLM) of speech, represented as discovered unit and prosodic feature streams, and an adapted HiFi-GAN model converting MS-TLM outputs to waveforms. We devise a series of metrics for prosody modeling and generation, and re-use metrics from GSLM for content modeling. Experimental results show that the pGSLM can utilize prosody to improve both prosody and content modeling, and also generate natural, meaningful, and coherent speech given a spoken prompt. Audio samples can be found at https://speechbot.github.io/pgslm. Codes and models are available at https://github.com/pytorch/fairseq/tree/main/examples/textless_nlp/pgslm.
研究动机与目标
- 开发一种无需文本的生成式口语语言模型,以保留先前无文本方法中丢失的韵律信息。
- 探究语音内容与韵律的联合建模是否能提升语音生成的质量与连贯性。
- 评估离散化与连续化韵律表征对生成多样性与一致性的影响力。
- 设计并验证在缺乏文本监督情况下的韵律建模与生成新指标。
- 实现条件语音生成,确保生成结果在语义与韵律上均与给定提示保持一致。
提出的方法
- 该模型采用多流 Transformer 语言模型(MS-TLM),分别处理自监督单元和量化后的韵律特征(F0 与时长)的独立流。
- 通过向量量化将韵律特征表示为离散标记,相比连续表示,能更好地建模多模态分布。
- MS-TLM 采用自回归方式训练,基于先前序列预测下一个单元与韵律标记,对离散标记使用交叉熵损失,对连续值使用 L1 损失。
- 通过微调的 HiFi-GAN 语音合成器将生成的单元与韵律序列转换为高保真波形。
- 通过内容指标(如 BLEU)与新设计的韵律指标(F0 与时长的 MAE,以及基于相关性的连贯性与表现力指标)组合评估模型性能。
- 消融研究对比了有无韵律输入以及离散化与连续化韵律表示的模型,以分离各项设计选择的影响。
实验结果
研究问题
- RQ1联合建模语音内容与韵律是否能同时提升无文本口语语言生成中的内容与韵律建模效果?
- RQ2与连续表示相比,使用离散化韵律表示是否能带来更高的生成多样性与一致性?
- RQ3在输入中包含韵律信息是否影响模型在自回归生成过程中保持韵律一致性的能力?
- RQ4相较于输入提示,具备韵律感知能力的建模在多大程度上提升了生成语音的连贯性与表现力?
- RQ5所提出的模型是否能在无任何文本监督的情况下生成自然、有意义且连贯的语音?
主要发现
- 在续写任务中,加入韵律输入的模型在时长(0.536 vs. 0.542)与 F0(0.077 vs. 0.096)上的 MAE 显著更低,表明韵律建模能力得到提升。
- 离散韵律模型(第 12 行)的 F0 值标准差是连续模型的两倍,表明其韵律多样性更高。
- 加入韵律输入的离散韵律模型在人类评估中取得最高 MOS(4.21)与 M-MOS(3.85),优于其他变体。
- 加入韵律输入后,韵律一致性相关性指标显著提升:时长相关性从 0.176 提升至 0.344,F0 相关性从 0.093 提升至 0.494。
- 加入韵律输入的模型在词级别 BLEU 分数更高(如第 12 行为 12.8,第 10 行为 12.5),表明内容建模能力得到改善。
- 离散韵律与韵律输入结合的模型在表现力、一致性与连贯性之间达到最佳平衡,经人类评估与指标分析验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。