[论文解读] AISHELL-4: An Open Source Dataset for Speech Enhancement, Separation, Recognition and Speaker Diarization in Conference Scenario
AISHELL-4 是一个120小时的中文多说话人会议语音数据集,采用8通道麦克风阵列在真实会议场景中录制,具有重叠、停顿和噪声等自然语音特征。本文提出了一套基于PyTorch的基线系统,集成语音增强、分离、识别与说话人分割功能,在前端处理后,说话人无关和说话人相关自动语音识别任务的字符错误率(CER)分别达到30.49%和39.86%,显著优于原始输入。
In this paper, we present AISHELL-4, a sizable real-recorded Mandarin speech dataset collected by 8-channel circular microphone array for speech processing in conference scenario. The dataset consists of 211 recorded meeting sessions, each containing 4 to 8 speakers, with a total length of 120 hours. This dataset aims to bridge the advanced research on multi-speaker processing and the practical application scenario in three aspects. With real recorded meetings, AISHELL-4 provides realistic acoustics and rich natural speech characteristics in conversation such as short pause, speech overlap, quick speaker turn, noise, etc. Meanwhile, accurate transcription and speaker voice activity are provided for each meeting in AISHELL-4. This allows the researchers to explore different aspects in meeting processing, ranging from individual tasks such as speech front-end processing, speech recognition and speaker diarization, to multi-modality modeling and joint optimization of relevant tasks. Given most open source dataset for multi-speaker tasks are in English, AISHELL-4 is the only Mandarin dataset for conversation speech, providing additional value for data diversity in speech community. We also release a PyTorch-based training and evaluation framework as baseline system to promote reproducible research in this field.
研究动机与目标
- 为解决多说话人语音处理领域缺乏大规模、真实世界中文会议语音数据集的问题。
- 弥合复杂声学环境(如会议室)中先进研究与实际应用之间的差距。
- 通过统一且真实的语音数据集,支持语音增强、分离、识别与分割的联合优化。
- 通过发布基于PyTorch的训练与评估框架,推动可复现的研究。
提出的方法
- 使用8通道圆形麦克风阵列在真实会议场所采集数据,共获得211个会议会话,每场会议包含4至8名说话人。
- 高精度标注包括词级转录、说话人发言段边界以及每个会议的语音活动检测(VAD)。
- 开发了多阶段基线系统,采用基于复谱图的波束成形方法进行语音增强与分离,其权重向量定义为 $ \mathbf{w}_f^k = \frac{\mathbf{R}_f^{-1}\mathbf{u}_r}{\mathbf{u}_r^H\mathbf{R}_f^{-1}\mathbf{u}_r} $。
- 语音识别采用2层2D卷积神经网络,后接8层Transformer编码器与6层解码器,使用联合CTC与交叉熵损失进行训练。
- 通过SpecAugment进行数据增强,并在模拟数据与真实录制数据(训练集768小时,开发集97小时)上进行混合训练,提升模型鲁棒性。
- 评估采用说话人无关与说话人相关的CER指标,前者使用真实分割结果,后者采用完整端到端流程。

实验结果
研究问题
- RQ1真实会议场景中的实际声学退化对自动语音识别性能有何影响?
- RQ2前端处理(增强、分离、SAD、说话人分割)在重叠、多说话人会议中能多大程度提升ASR准确率?
- RQ3将增强、分离、识别与说话人分割整合为统一的端到端流水线,是否能优于孤立模块的性能?
- RQ4在合成数据上训练的ASR模型,与在同领域真实录音上微调的模型相比,性能如何?
主要发现
- 基线系统在使用未经处理的原始输入时,说话人无关ASR任务的CER为32.56%,表明真实声学环境对性能有显著影响。
- 在应用前端处理(增强、分离、SAD与说话人分割)后,说话人无关任务的CER下降至30.49%,显示出可测量的性能提升。
- 在说话人相关任务中,CER从41.55%降至39.86%,表明在完整端到端评估中性能提升具有一致性。
- 在训练中引入真实录制数据(63小时)显著提升了模型的泛化能力,优于仅使用合成数据的模型。
- 所提出的基于PyTorch的框架支持可复现研究,并促进语音处理任务间的联合优化。
- AISHELL-4是首个大规模、真实录制的中文会议语音数据集,在非英语语音处理研究中具有独特价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。