[论文解读] Peking Opera Synthesis via Duration Informed Attention Network
本文提出了一种时长感知注意力网络(DurIAN),并结合拉格朗日乘子优化的混合密度网络(MDN),用于富有表现力的京剧演唱合成。通过数据驱动的优化方法建模音素时长,并利用从真实演唱中提取的伪乐谱,该系统在时长预测误差方面显著优于基于规则的方法,同时生成更自然的音高轮廓,实现了高质量、富有表现力的乐谱驱动合成。
Peking Opera has been the most dominant form of Chinese performing art since around 200 years ago. A Peking Opera singer usually exhibits a very strong personal style via introducing improvisation and expressiveness on stage which leads the actual rhythm and pitch contour to deviate significantly from the original music score. This inconsistency poses a great challenge in Peking Opera singing voice synthesis from a music score. In this work, we propose to deal with this issue and synthesize expressive Peking Opera singing from the music score based on the Duration Informed Attention Network (DurIAN) framework. To tackle the rhythm mismatch, Lagrange multiplier is used to find the optimal output phoneme duration sequence with the constraint of the given note duration from music score. As for the pitch contour mismatch, instead of directly inferring from music score, we adopt a pseudo music score generated from the real singing and feed it as input during training. The experiments demonstrate that with the proposed system we can synthesize Peking Opera singing voice with high-quality timbre, pitch and expressiveness.
研究动机与目标
- 解决由于即兴创作和表现性变化导致的京剧演唱合成中节奏与音高不匹配的问题。
- 克服在京剧常见长时长、非标准音素结构中,基于规则的音素时长缩放方法(如Fitting Heuristic)的局限性。
- 通过在训练过程中从真实演唱波形生成伪乐谱,提升乐谱输入与声学输出之间的对齐。
- 实现高保真、富有表现力的演唱合成,准确捕捉京剧特有的震音、音高变化与音色特征。
- 通过客观指标与主观平均意见得分(MOS)测试评估系统性能。
提出的方法
- 采用基于DurIAN的自回归框架,生成基于预测音高与音素序列条件的声谱图特征。
- 提出一种上下文感知的混合密度网络(MDN),结合拉格朗日乘子优化,用于预测音素时长,替代基于规则的Fitting Heuristic方法。
- 拉格朗日乘子方法强制约束总预测音素时长与乐谱中给定的音符时长一致,从而实现最优时长序列估计。
- 通过旋律转录算法从真实演唱波形中生成伪乐谱,并在训练过程中作为输入,以对齐声学特征与输入乐谱。
- 系统采用带有音高条件的编码器(含CBHG模块)与解码器,以建模时间依赖性并生成富有表现力的音高轮廓。
- 模型使用一个独特的京剧数据集进行训练,该数据集包含标注的音素、时长与转录的音符音高。
实验结果
研究问题
- RQ1基于数据驱动的时长建模方法是否能在京剧高度可变的音素时长建模中超越基于规则的Fitting Heuristic方法?
- RQ2从真实演唱中提取的伪乐谱在提升输入乐谱与生成音频之间对齐效果方面有多有效?
- RQ3所提系统在多大程度上能够准确建模京剧演唱特有的表现性震音与音高变化?
- RQ4MDN结合拉格朗日优化是否能比标准回归或基于Softmax的方法实现更精确的音素时长预测?
- RQ5合成京剧演唱的主观自然度与真实演唱相比如何?
主要发现
- 所提出的BiLSTM-MDN-Lag时长模型在所有音符上的平均音素时长预测误差为8.91帧,显著低于Fitting Heuristic基线(19.61帧)及其他变体。
- 对于时长小于2秒的音符,该方法的预测误差仅为3.24帧,表明在短时长情境下具有更高的精度。
- 系统在主观听音测试中获得3.34的平均意见得分(MOS),表明其自然度与可懂度处于可接受水平。
- 生成的音高轮廓富含震音与动态过渡,与真实京剧演唱的表现特征高度一致。
- BiLSTM-MDN-Lag模型在长音符上的表现优于BiLSTM-MSE-Fit与BiLSTM-MDN-Fit,尤其因其能避免因错误识别主元音而导致的误差。
- 在训练中使用伪乐谱有效缓解了真实演唱与输入乐谱之间的不一致性,提升了训练与推理阶段的对齐效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。