[论文解读] Adversarially Trained Multi-Singer Sequence-To-Sequence Singing Synthesizer
本文提出了一种经过对抗训练的多歌手序列到序列歌唱合成器,通过利用多样化的歌手数据,在目标歌手数据有限的情况下提升了音质。该方法使用歌手分类器以减少说话人相关表征,并采用多种随机窗口判别器(MRWDs)以增强真实感与发音清晰度,实现了4.12的MOS评分——显著优于基线模型(3.53),并在高音元音清晰度方面有显著提升。
This paper presents a high quality singing synthesizer that is able to model a voice with limited available recordings. Based on the sequence-to-sequence singing model, we design a multi-singer framework to leverage all the existing singing data of different singers. To attenuate the issue of musical score unbalance among singers, we incorporate an adversarial task of singer classification to make encoder output less singer dependent. Furthermore, we apply multiple random window discriminators (MRWDs) on the generated acoustic features to make the network be a GAN. Both objective and subjective evaluations indicate that the proposed synthesizer can generate higher quality singing voice than baseline (4.12 vs 3.53 in MOS). Especially, the articulation of high-pitched vowels is significantly enhanced.
研究动机与目标
- 为解决自定义歌唱音色训练数据有限的挑战,通过在歌手间共享数据实现多歌手训练。
- 缓解因乐谱和人声录音分布不均导致的歌手间数据不平衡问题。
- 通过对抗训练提升合成歌唱音色的真实感与发音清晰度,尤其针对高音元音。
- 通过将前馈序列到序列Transformer架构扩展至多歌手场景,减少推理时间与暴露偏差。
- 通过解耦说话人表征与基于GAN的生成,实现仅用极少目标歌手数据即可获得高质量个性化歌唱语音合成。
提出的方法
- 将基于序列到序列Transformer的歌唱合成器扩展为支持多个歌手,采用可学习的歌手嵌入。
- 引入歌手分类器作为对抗头,以最小化编码器输出中的说话人身份信息,促进说话人无关表征学习。
- 在生成的声学特征局部段落上应用多种随机窗口判别器(MRWDs),实现在不同时间尺度上的精细化真实感评估。
- MRWDs作为条件与非条件判别器的集成,在全音频的随机采样子序列上运行,增强泛化能力与多样性。
- 使用真实音素时长与WORLD声码器特征(MGC、BAP、F0),解耦时长建模,集中提升谱质。
- 通过结合歌手分类器与MRWDs的GAN框架实施对抗训练,同时优化说话人不变编码与逼真声学生成。
实验结果
研究问题
- RQ1在仅有限目标歌手数据的情况下,基于多歌手数据训练的序列到序列歌唱合成器是否能实现比单歌手基线更高的音质?
- RQ2通过歌手分类器进行对抗训练,是否能有效减少编码器中的说话人相关表征,从而缓解歌手间的数据不平衡问题?
- RQ3与单判别器GAN相比,多种随机窗口判别器(MRWDs)是否能提升真实感并减少生成声学特征的过度平滑?
- RQ4所提方法在多大程度上增强了高音元音的发音清晰度,这一问题在歌唱合成中长期存在挑战?
- RQ5结合歌手分类器与MRWDs是否在主观与客观评估指标上产生协同增益?
主要发现
- 所提模型取得了4.12的平均意见得分(MOS),显著优于基线系统(3.53),证明了其卓越的音质表现。
- A/B偏好测试显示,采用歌手分类器的系统在统计上具有显著优势(p < 0.001),尤其在高音元音发音方面表现更优。
- 歌手分类器与MRWDs的结合(System5)生成了最清晰的梅尔倒谱图,高音元音如'qi a_h nn_h'的谐波结构清晰可辨。
- MRWDs有效减少了生成特征的过度平滑,表现为全局方差(GV)轨迹更接近真实值。
- 即使目标歌手数据较少,多歌手模块仍能提升性能,其GV与MOS得分与单歌手基线相当或更优。
- 歌手分类器对GV影响甚微,但显著提升了主观音质,尤其在高音音素等数据稀疏条件下表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。