[论文解读] The Singing Voice Conversion Challenge 2023
本文介绍了2023年歌唱语音转换挑战赛(SVCC),该赛事基于NHSS数据集的精选子集,在域内和跨域任务上对大规模歌唱语音转换(SVC)系统进行了评估。尽管所有系统在自然度方面达到了人类水平,但没有一个系统能匹配目标说话人的相似度,且客观指标与主观评分之间的相关性较弱,凸显了SVC性能评估的挑战。
We present the latest iteration of the voice conversion challenge (VCC) series, a bi-annual scientific event aiming to compare and understand different voice conversion (VC) systems based on a common dataset. This year we shifted our focus to singing voice conversion (SVC), thus named the challenge the Singing Voice Conversion Challenge (SVCC). A new database was constructed for two tasks, namely in-domain and cross-domain SVC. The challenge was run for two months, and in total we received 26 submissions, including 2 baselines. Through a large-scale crowd-sourced listening test, we observed that for both tasks, although human-level naturalness was achieved by the top system, no team was able to obtain a similarity score as high as the target speakers. Also, as expected, cross-domain SVC is harder than in-domain SVC, especially in the similarity aspect. We also investigated whether existing objective measurements were able to predict perceptual performance, and found that only few of them could reach a significant correlation.
研究动机与目标
- 使用标准化数据集和通用评估协议,评估并比较最先进的歌唱语音转换(SVC)系统。
- 探究感知性能(自然度与相似度)与客观评估指标之间的差距。
- 通过大规模主观听音测试,评估跨域SVC相较于域内SVC的难度。
- 识别哪些客观指标能够可靠预测人类感知,特别是在说话人相似度和自然度方面。
- 通过识别未解决的挑战,推动该领域发展,并为SVC系统客观评估的未来研究提供指导。
提出的方法
- 基于NHSS数据集构建了一个新数据库,支持两类任务:任意到单一的域内SVC和任意到单一的跨域SVC。
- 参赛者在提供的数据集上训练SVC系统,并提交转换后的歌唱样本以供评估。
- 组织了大规模众包听音测试,邀请母语为英语和日语的听者评估自然度与说话人相似度。
- 客观指标包括梅尔倒谱失真(MCD)、F0均方根误差(RMSE)与相关系数、来自两个ASR模型的字符错误率(CER)、歌手嵌入余弦相似度,以及神经网络MOS预测器(UTMOS和SSL-MOS)。
- 计算客观指标与主观评分之间的斯皮尔曼等级相关系数,以评估其预测性能。
- 通过使用统一数据集和标准化听音流程,评估框架确保了结果的一致性与可复现性。
实验结果
研究问题
- RQ1顶尖SVC系统在域内和跨域设置下,能在多大程度上实现人类水平的自然度?
- RQ2为何现有客观指标在SVC中与主观相似度评分的相关性较弱?
- RQ3在自然度与说话人相似度方面,跨域SVC与域内SVC相比如何?
- RQ4当前客观指标(如MCD、F0指标或基于ASR的CER)能否可靠预测SVC中的感知质量?
- RQ5神经网络MOS预测器(如UTMOS)在预测歌唱语音转换中自然度方面的表现如何?
主要发现
- 顶尖SVC系统在域内和跨域任务中均实现了人类水平的自然度,表明音频质量方面取得了显著进展。
- 没有一个系统能达到目标说话人的相似度评分水平,表明身份保留方面仍存在持久差距。
- 跨域SVC显著难于域内SVC,其平均自然度与相似度评分均较低。
- 仅有少数客观指标——特别是来自ASR模型的CER和歌手嵌入余弦相似度——与主观相似度评分表现出统计显著相关性。
- 在相似度方面表现最佳的客观指标(歌手嵌入余弦距离)与母语听者评估的相关性仍然微弱,尤其在跨域设置下更为明显。
- 神经网络MOS预测器(如UTMOS)与自然度表现出中等相关性,表明其从语音到歌唱的泛化能力,但预测能力有限仍是主要挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。