Skip to main content
QUICK REVIEW

[论文解读] The Singing Voice Conversion Challenge 2023

Wen-Chin Huang, Lester Phillip Violeta|arXiv (Cornell University)|Jun 26, 2023
Speech Recognition and Synthesis被引用 4
一句话总结

本文介绍了2023年歌唱语音转换挑战赛(SVCC),该赛事基于NHSS数据集的精选子集,在域内和跨域任务上对大规模歌唱语音转换(SVC)系统进行了评估。尽管所有系统在自然度方面达到了人类水平,但没有一个系统能匹配目标说话人的相似度,且客观指标与主观评分之间的相关性较弱,凸显了SVC性能评估的挑战。

ABSTRACT

We present the latest iteration of the voice conversion challenge (VCC) series, a bi-annual scientific event aiming to compare and understand different voice conversion (VC) systems based on a common dataset. This year we shifted our focus to singing voice conversion (SVC), thus named the challenge the Singing Voice Conversion Challenge (SVCC). A new database was constructed for two tasks, namely in-domain and cross-domain SVC. The challenge was run for two months, and in total we received 26 submissions, including 2 baselines. Through a large-scale crowd-sourced listening test, we observed that for both tasks, although human-level naturalness was achieved by the top system, no team was able to obtain a similarity score as high as the target speakers. Also, as expected, cross-domain SVC is harder than in-domain SVC, especially in the similarity aspect. We also investigated whether existing objective measurements were able to predict perceptual performance, and found that only few of them could reach a significant correlation.

研究动机与目标

  • 使用标准化数据集和通用评估协议,评估并比较最先进的歌唱语音转换(SVC)系统。
  • 探究感知性能(自然度与相似度)与客观评估指标之间的差距。
  • 通过大规模主观听音测试,评估跨域SVC相较于域内SVC的难度。
  • 识别哪些客观指标能够可靠预测人类感知,特别是在说话人相似度和自然度方面。
  • 通过识别未解决的挑战,推动该领域发展,并为SVC系统客观评估的未来研究提供指导。

提出的方法

  • 基于NHSS数据集构建了一个新数据库,支持两类任务:任意到单一的域内SVC和任意到单一的跨域SVC。
  • 参赛者在提供的数据集上训练SVC系统,并提交转换后的歌唱样本以供评估。
  • 组织了大规模众包听音测试,邀请母语为英语和日语的听者评估自然度与说话人相似度。
  • 客观指标包括梅尔倒谱失真(MCD)、F0均方根误差(RMSE)与相关系数、来自两个ASR模型的字符错误率(CER)、歌手嵌入余弦相似度,以及神经网络MOS预测器(UTMOS和SSL-MOS)。
  • 计算客观指标与主观评分之间的斯皮尔曼等级相关系数,以评估其预测性能。
  • 通过使用统一数据集和标准化听音流程,评估框架确保了结果的一致性与可复现性。

实验结果

研究问题

  • RQ1顶尖SVC系统在域内和跨域设置下,能在多大程度上实现人类水平的自然度?
  • RQ2为何现有客观指标在SVC中与主观相似度评分的相关性较弱?
  • RQ3在自然度与说话人相似度方面,跨域SVC与域内SVC相比如何?
  • RQ4当前客观指标(如MCD、F0指标或基于ASR的CER)能否可靠预测SVC中的感知质量?
  • RQ5神经网络MOS预测器(如UTMOS)在预测歌唱语音转换中自然度方面的表现如何?

主要发现

  • 顶尖SVC系统在域内和跨域任务中均实现了人类水平的自然度,表明音频质量方面取得了显著进展。
  • 没有一个系统能达到目标说话人的相似度评分水平,表明身份保留方面仍存在持久差距。
  • 跨域SVC显著难于域内SVC,其平均自然度与相似度评分均较低。
  • 仅有少数客观指标——特别是来自ASR模型的CER和歌手嵌入余弦相似度——与主观相似度评分表现出统计显著相关性。
  • 在相似度方面表现最佳的客观指标(歌手嵌入余弦距离)与母语听者评估的相关性仍然微弱,尤其在跨域设置下更为明显。
  • 神经网络MOS预测器(如UTMOS)与自然度表现出中等相关性,表明其从语音到歌唱的泛化能力,但预测能力有限仍是主要挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。