[论文解读] High-quality Speech Synthesis Using Super-resolution Mel-Spectrogram
本文提出了一种超分辨率梅尔频谱图模型,通过结合Pix2PixHD与ResUnet架构的条件生成对抗网络框架,增强由文本到语音(TTS)模型生成的低质量梅尔频谱图。通过将梅尔频谱图视为图像,该方法重建了细微的声学细节,在使用Griffin-Lim时相比基线模型提升0.44 MOS,在使用WaveNet时提升0.17 MOS,接近真实音频质量。
In speech synthesis and speech enhancement systems, melspectrograms need to be precise in acoustic representations. However, the generated spectrograms are over-smooth, that could not produce high quality synthesized speech. Inspired by image-to-image translation, we address this problem by using a learning-based post filter combining Pix2PixHD and ResUnet to reconstruct the mel-spectrograms together with super-resolution. From the resulting super-resolution spectrogram networks, we can generate enhanced spectrograms to produce high quality synthesized speech. Our proposed model achieves improved mean opinion scores (MOS) of 3.71 and 4.01 over baseline results of 3.29 and 3.84, while using vocoder Griffin-Lim and WaveNet, respectively.
研究动机与目标
- 解决生成梅尔频谱图中存在的过度平滑问题,该问题会降低合成语音质量。
- 提升端到端TTS模型(如Tacotron2)生成的梅尔频谱图保真度。
- 利用图像到图像翻译技术,通过将梅尔频谱图视为图像,实现语音信号增强。
- 通过深度学习重建详细频谱图结构,实现高质量语音合成。
- 通过增强梅尔频谱图预测,缩小合成语音与真实音频之间的差距。
提出的方法
- 该模型采用基于Pix2PixHD的条件生成对抗网络框架,结合粗到细的生成器与多尺度判别器。
- 基于ResUnet的局部增强网络替代Pix2PixHD中的原始生成器,以提升特征重建与细节恢复能力。
- 生成器采用跳跃连接与残差块,以在超分辨率过程中保留细微的频谱图细节。
- 训练采用组合损失函数,包括对抗损失与多尺度特征匹配损失,以稳定训练过程。
- 在13,000对粗糙与原始梅尔频谱图配对数据上进行训练,使用Adam优化器并配合学习率衰减。
- 增强后的梅尔频谱图随后通过Griffin-Lim与WaveNet声码器转换为波形,用于评估。
实验结果
研究问题
- RQ1图像到图像翻译模型能否有效从低质量TTS输出中重建高保真度梅尔频谱图?
- RQ2基于Pix2PixHD与ResUnet的超分辨率模型在恢复细微频谱图细节方面,相较于基线TTS系统表现如何?
- RQ3增强后的梅尔频谱图在MOS与客观指标上的提升程度如何?
- RQ4所提方法是否在不同声码器下均能缩小合成语音与真实音频之间的差距?
- RQ5该模型是否能在保持高感知质量的前提下,泛化至不同声码器(如Griffin-Lim与WaveNet)?
主要发现
- 所提模型在使用Griffin-Lim时取得3.73的平均意见得分(MOS),使用WaveNet时为4.01,显著优于基线的3.29与3.84。
- 预测梅尔频谱图的SSIM值达到0.920,接近原始值1.00,表明结构相似度高。
- STOI分数从基线的0.791提升至Griffin-Lim的0.978与WaveNet的0.919,显示语音可懂度显著增强。
- 视觉验证显示,该模型有效恢复了粗糙梅尔频谱图中缺失的谐波与瞬态结构(见图4)。
- MOS结果表明,增强后的语音在感知上接近原始音频,使用Griffin-Lim时提升0.44,使用WaveNet时提升0.17。
- 该模型在不同声码器下表现稳健,展示了在语音合成中良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。