[论文解读] DiDiSpeech: A Large Scale Mandarin Speech Corpus
DiDiSpeech 是一个大规模、开源的普通话语音语料库,包含约 800 小时的高质量 48kHz 音频,来自 6,000 名母语者,专为多种语音处理任务设计。它在自动语音识别(词错误率:2.50%)、语音转换、多说话人文本到语音合成以及副语言任务(如说话人识别,准确率 98.20%)和年龄估计(平均绝对误差:3.76)方面实现了最先进性能,证明了其在科研与工业应用中的实用性。
This paper introduces a new open-sourced Mandarin speech corpus, called DiDiSpeech. It consists of about 800 hours of speech data at 48kHz sampling rate from 6000 speakers and the corresponding texts. All speech data in the corpus is recorded in quiet environment and is suitable for various speech processing tasks, such as voice conversion, multi-speaker text-to-speech and automatic speech recognition. We conduct experiments with multiple speech tasks and evaluate the performance, showing that it is promising to use the corpus for both academic research and practical application. The corpus is available at https://outreach.didichuxing.com/research/opendata/.
研究动机与目标
- 为解决缺乏大规模、高质量、多用途普通话语音语料库的问题,以满足多样化语音处理任务的需求。
- 通过提供可扩展、开放获取的数据集,弥合学术研究与工业应用在普通话语音技术之间的差距。
- 支持语音转换、多说话人文本到语音合成、自动语音识别以及副语言信息提取(如说话人、性别和年龄分类)等高级研究。
- 通过控制录音环境(安静环境)和在年龄、性别与地理分布上的均衡,确保数据质量。
- 发布一个支持平行与非平行语音样本的语料库,以实现灵活的模型训练与评估。
提出的方法
- 该语料库分为两个子集:DiDiSpeech-1(572 小时,4,500 名说话人)用于语音转换和多说话人文本到语音合成,DiDiSpeech-2(227 小时,1,500 名说话人)用于自动语音识别和副语言任务。
- 所有音频均在安静环境中以 48kHz 采样率录制,并为所有语音样本提供了对应转录文本。
- 在自动语音识别方面,采用 Transformer-ASR 模型,结合束搜索、语言建模与 CTC-联合解码,DiDiSpeech-2 上的词错误率(CER)达到 2.50%。
- 对于说话人与性别分类,采用轻量级 ResNet-34 架构,输入为 40 或 80 维滤波器组特征,随后通过平均池化与 Softmax 层实现 6,000 类分类。
- 对于年龄估计,采用相同模型架构,以平均绝对误差(MAE)与皮尔逊相关系数作为评估指标,使用较小的初始学习率以确保收敛。
- 数据通过从每位说话人中随机选取四个语音样本的方式划分为训练集、开发集与测试集,未使用数据增强或语音活动检测。

实验结果
研究问题
- RQ1DiDiSpeech 是否能够支持普通话中高性能的自动语音识别?其与现有基准相比表现如何?
- RQ2在低资源环境下,DiDiSpeech 在实现有效语音转换与多说话人文本到语音合成方面能达到何种程度?
- RQ3DiDiSpeech 在说话人识别、性别分类与年龄估计等副语言任务中的支持能力如何?
- RQ4DiDiSpeech 的人口统计多样性与数据质量是否能带来在年龄、性别与地区口音上的鲁棒泛化能力?
- RQ5DiDiSpeech 是否可作为专有工业数据集的可行替代方案,以推动普通话语音技术的发展?
主要发现
- 在 DiDiSpeech-2 上,使用带有 CTC-联合解码的 Transformer-ASR 模型,词错误率(CER)达到 2.50%,证明了其强大的自动语音识别性能。
- 在 DiDiSpeech 上进行的说话人分类在测试集上达到 98.20% 的 top-1 准确率与 99.76% 的 top-5 准确率,表明模型具有高度可靠性。
- 性别分类在开发集与测试集上均达到 97.39% 的准确率,表明在成年男性、成年女性与儿童中均表现优异。
- 年龄估计在测试集上实现 MAE 为 3.76,皮尔逊相关系数为 0.79,表明对说话人年龄的预测具有合理准确性。
- 该语料库支持多种语音任务,包括语音转换、多说话人文本到语音合成与说话人分割,所有评估任务均表现出一致性能。
- DiDiSpeech-1 中同时包含平行与非平行语音样本,支持语音转换与零样本迁移学习场景下的灵活训练。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。