[论文解读] Score and Lyrics-Free Singing Voice Generation
本文提出了一项新颖的无评分与无歌词的演唱语音生成任务,提出三种方案——自由演唱、伴奏演唱与独唱演唱,采用基于 GAN 的架构结合 GRU 与空洞卷积,从原始音频生成梅尔频谱图,实现无需事先语言或音乐监督的可信演唱语音,尽管音频质量仍有局限。
Generative models for singing voice have been mostly concerned with the task of ``singing voice synthesis,'' i.e., to produce singing voice waveforms given musical scores and text lyrics. In this work, we explore a novel yet challenging alternative: singing voice generation without pre-assigned scores and lyrics, in both training and inference time. In particular, we outline three such generation schemes, and propose a pipeline to tackle these new tasks. Moreover, we implement such models using generative adversarial networks and evaluate them both objectively and subjectively.
研究动机与目标
- 探索无需预设乐谱或歌词的演唱语音生成,以实现更具艺术性与自发性的 vocal 表达。
- 解决在缺乏音素或音高标注的未配对、无监督演唱数据上训练模型的挑战。
- 开发一种生成框架,能够从无条件或弱条件输入生成多样化、富有表现力的演唱语音。
- 评估生成语音的人性化程度、表现力以及与伴奏的兼容性,尽管音频质量有限。
- 通过允许模型基于内部音乐构思生成演唱,而非固定输入,实现计算创造力。
提出的方法
- 提出一种基于 BEGAN 的 GAN 架构,结合门控循环单元(GRUs)与分组空洞卷积,以建模梅尔频谱图中的序列与局部模式。
- 使用声码器将生成的梅尔频谱图转换为原始音频波形,避免对声学特征对齐的显式需求。
- 采用最先进的音源分离模型从完整音频录音中提取人声与伴奏音轨,实现从公开音乐资源中收集数据。
- 训练三种不同模型:自由演唱者(无输入)、伴奏演唱者(输入:乐器波形)与独唱演唱者(输入:随机噪声以生成内部音乐构思)。
- 应用对抗性损失与多尺度判别器组件,以提升生成演唱语音的感知质量与多样性。
- 引入一种兼容性度量指标,评估生成人声与给定伴奏音轨的对齐程度,即使缺乏真实音高或歌词对齐。
实验结果
研究问题
- RQ1生成模型能否在无乐谱或歌词输入的情况下生成可信的演唱语音?
- RQ2模型如何仅从原始音频学习生成富有表现力且连贯的演唱,而无需音高、音素或时间的监督?
- RQ3从原始演唱音频中进行无监督学习,能在多大程度上生成听起来自然且富有情感表现力的语音?
- RQ4模型如何在相同伴奏下生成多样化的演唱输出,以体现艺术自由与即兴创作?
- RQ5在无评分与无歌词的演唱语音生成中,音频质量与表现力之间的权衡如何?
主要发现
- 所提出的模型成功在无任何乐谱或歌词输入的情况下生成演唱语音,证明可信演唱可仅从原始音频中自然涌现。
- 主观评估显示,生成语音被感知为具有人类特征且富有表现力,尽管音频质量仍逊于当前最先进的 SVS 系统。
- 伴奏演唱者模型生成的人声与输入伴奏音轨具有良好的兼容性,经由自定义兼容性度量验证,即使无真实对齐信息。
- 自由演唱者在无输入情况下仍能生成类似人声的音效,表明模型从训练数据中学习到了内在的音乐结构。
- GRU 与空洞卷积的结合有效建模了演唱语音生成中的序列与长程依赖关系。
- 用户研究中 Synthesizer V 作为基线模型可能拉低了对本模型感知质量的评分,表明在音频保真度方面仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。