[论文解读] SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
SpeechX 是一种统一的神经编解码语言模型,通过多任务学习与任务特定提示,实现端到端的语音生成与转换,在单一统一架构下,实现了零样本TTS、噪声抑制、目标说话人提取、语音移除和语音编辑等多种任务的最先进或具有竞争力的性能,无论在干净还是嘈杂环境下均表现优异。
Recent advancements in generative speech models based on audio-text prompts have enabled remarkable innovations like high-quality zero-shot text-to-speech. However, existing models still face limitations in handling diverse audio-text speech generation tasks involving transforming input speech and processing audio captured in adverse acoustic conditions. This paper introduces SpeechX, a versatile speech generation model capable of zero-shot TTS and various speech transformation tasks, dealing with both clean and noisy signals. SpeechX combines neural codec language modeling with multi-task learning using task-dependent prompting, enabling unified and extensible modeling and providing a consistent way for leveraging textual input in speech enhancement and transformation tasks. Experimental results show SpeechX's efficacy in various tasks, including zero-shot TTS, noise suppression, target speaker extraction, speech removal, and speech editing with or without background noise, achieving comparable or superior performance to specialized models across tasks. See https://aka.ms/speechx for demo samples.
研究动机与目标
- 解决缺乏统一生成模型来处理多样化语音-文本语音任务(包括嘈杂和多人说话语音的转换)的问题。
- 克服先前模型无法在噪声信号上执行语音编辑,或在无专用架构的情况下处理目标说话人提取的局限性。
- 通过单一可扩展的模型架构,实现对文本和声学提示的一致性条件控制,实现鲁棒的零样本语音生成与转换。
- 在单一神经编解码语言建模范式下,统一TTS、去噪、说话人提取、移除与编辑等多种语音任务,使用任务特定标记。
- 通过在多样化语音条件下进行训练,提升模型对声学失真的鲁棒性,同时在各项任务中保持高质量输出。
提出的方法
- 采用神经编解码语言模型,基于文本和声学提示生成离散声学标记,实现端到端的语音生成与转换。
- 引入任务特定的条件控制标记(如 'TTS'、'denoise'、'extract'),通过多任务学习在单一模型架构中统一多种任务。
- 将文本输入作为可选但信息丰富的提示,以指导语音增强与转换,提升解耦效果与可懂度。
- 在混合任务上端到端训练模型,包括零样本TTS、语音编辑、噪声抑制、语音移除与目标说话人提取,共享声学与文本编码器。
- 利用EnCodec模型进行声学标记化,但性能受限于编解码器引入的失真,尤其在PESQ评分上表现明显下降。
- 采用统一的推理机制,模型在输入音频、文本(如可用)和任务特定标记的条件下生成声学标记。
实验结果
研究问题
- RQ1单一统一的生成模型能否有效处理多样化的基于语音-文本的语音任务,包括在嘈杂环境中的零样本TTS与语音转换?
- RQ2将文本输入作为提示,能否提升语音增强与转换任务(如噪声抑制与目标说话人提取)的性能?
- RQ3多任务训练在多大程度上提升了不同语音生成与转换任务之间的鲁棒性与泛化能力?
- RQ4使用神经编解码器对下游语音生成与转换任务的性能有何影响,特别是在PESQ与DNSMOS等质量指标上的表现?
- RQ5统一模型能否在噪声信号上实现具有竞争力的语音编辑性能,而此前的模型仅限于处理干净输入?
主要发现
- SpeechX在所有评估任务中均达到与专用模型相当或更优的性能,包括零样本TTS、噪声抑制、目标说话人提取、语音移除与语音编辑。
- 引入文本输入显著提升了目标说话人提取任务中的DNSMOS与WER得分,表明对目标说话人语音与干扰说话人的解耦效果更好。
- 在语音编辑任务上进行训练可提升零样本TTS性能,表明任务多样性带来的数据分布偏移具有积极作用。
- 在训练中加入噪声抑制与语音移除任务可增强语音编辑对噪声的鲁棒性,尽管在干净语音编辑质量上略有权衡。
- 使用EnCodec进行声学标记化导致PESQ评分显著下降(干净语音上从4.64降至2.69),表明编解码器与评估指标之间的不匹配构成性能瓶颈。
- 即使在训练中包含目标说话人提取任务,SpeechX在噪声抑制与语音移除任务中仍保持强劲性能,未出现性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。