[论文解读] M2MeT: The ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge
本论文介绍了M2MeT挑战赛,这是一个大规模的中文多通道、多说话人会议转录数据集(AliMeeting),包含120小时的远场(8通道阵列)和近场(头戴式麦克风)录音,并设立了两个赛道——说话人分割和多说话人自动语音识别(ASR)。采用基于Conformer的SOT(序列输出训练)模型与ESPnet工具包,该研究在使用波束成形的远场测试集上实现了29.7%的词错误率(CER),表明外部数据和数据增强技术带来了显著性能提升。
Recent development of speech processing, such as speech recognition, speaker diarization, etc., has inspired numerous applications of speech technologies. The meeting scenario is one of the most valuable and, at the same time, most challenging scenarios for the deployment of speech technologies. Specifically, two typical tasks, speaker diarization and multi-speaker automatic speech recognition have attracted much attention recently. However, the lack of large public meeting data has been a major obstacle for the advancement of the field. Therefore, we make available the AliMeeting corpus, which consists of 120 hours of recorded Mandarin meeting data, including far-field data collected by 8-channel microphone array as well as near-field data collected by headset microphone. Each meeting session is composed of 2-4 speakers with different speaker overlap ratio, recorded in rooms with different size. Along with the dataset, we launch the ICASSP 2022 Multi-channel Multi-party Meeting Transcription Challenge (M2MeT) with two tracks, namely speaker diarization and multi-speaker ASR, aiming to provide a common testbed for meeting rich transcription and promote reproducible research in this field. In this paper we provide a detailed introduction of the AliMeeting dateset, challenge rules, evaluation methods and baseline systems.
研究动机与目标
- 为解决多说话人语音处理领域缺乏大规模公开的中文会议语料的问题。
- 通过ICASSP 2022挑战赛建立一个通用的多通道、多说话人会议转录评估平台。
- 通过发布多样化、真实场景的会议数据集,包含丰富标注和多种录音条件,推动可复现的研究。
- 利用真实会议数据对说话人分割和多说话人ASR的最先进性能进行基准测试。
- 探究数据增强和外部数据对模型在复杂声学环境下的泛化能力的影响。
提出的方法
- AliMeeting数据集包含120小时的中文会议录音,通过8通道定向阵列和头戴式麦克风录制,每场会议有2–4名说话人,且重叠比例各不相同。
- 挑战赛包含两个赛道:说话人分割和多说话人自动语音识别(ASR),并采用标准化的评估协议和指标。
- 在多说话人ASR任务中,采用SOT(序列输出训练)方法,通过在不同说话人语音片段之间插入<sc>标记,建模说话人切换。
- 模型采用12层、4头注意力机制的Conformer编码器,输入为梅尔滤波器组特征(71维,帧长25ms,帧移10ms)。
- 使用外部数据(Aishell-1、AIDataTang、ST-CMD)提升模型泛化能力,最终模型在近场数据中模拟了噪声和混响。
- 所有基线系统均使用ESPnet工具包实现与训练,训练过程超过100个周期,前25,000次迭代采用学习率预热策略。

实验结果
研究问题
- RQ1在真实会议场景中,远场与近场数据的联合使用对多说话人ASR性能有何影响?
- RQ2外部、域外数据在远场会议转录任务中能在多大程度上提升模型泛化能力?
- RQ3波束成形与数据增强(如模拟噪声/混响)在提升真实远场数据上模型鲁棒性方面有多有效?
- RQ4在语音重叠条件下,基于SOT的多说话人ASR相较于单说话人基线模型的性能增益如何?
- RQ5在可变说话人数量场景下,SOT方法与基于排列的训练方法在CER表现和可扩展性方面有何差异?
主要发现
- 在使用近场数据微调并结合波束成形后,基于SOT的多说话人ASR模型在远场测试集上实现了29.7%的CER,显著优于单说话人基线模型。
- 在外部近场数据上应用模拟噪声与混响(ConformerD)后,远场数据的CER从35.0%降低至33.3%,显示出显著的泛化优势。
- 在单说话人设置下,将Aishell-1、AIDataTang和ST-CMD数据加入训练集后,远场数据的CER从37.5%降至24.7%。
- 结合波束成形的SOT模型(SOTB_bf)在Ali-far-bf数据集上实现了29.7%的CER,优于SOTA基线(41.2%),并在混响环境中表现出强鲁棒性。
- 基于FIFO的SOT训练策略优于完整的排列基PIT方法,在更低计算成本下实现了更优的CER表现。
- AliMeeting数据集与M2MeT挑战赛共同构建了一个标准化基准,支持多个研究团队之间的可复现评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。