[论文解读] GPU-accelerated Guided Source Separation for Meeting Transcription
本论文提出了一种用于会议转录的GPU加速引导源分离(GSS)实现,通过在GPU上批量处理频率和时序段,实现了相较于基于CPU的推理300倍的速度提升。该方法支持详细的消融研究,并为LibriCSS、AMI和AliMeeting基准提供了端到端可复现的处理流程,结合说话人归属的ASR模型,实现了最先进的词错误率(WER)降低效果。
Guided source separation (GSS) is a type of target-speaker extraction method that relies on pre-computed speaker activities and blind source separation to perform front-end enhancement of overlapped speech signals. It was first proposed during the CHiME-5 challenge and provided significant improvements over the delay-and-sum beamforming baseline. Despite its strengths, however, the method has seen limited adoption for meeting transcription benchmarks primarily due to its high computation time. In this paper, we describe our improved implementation of GSS that leverages the power of modern GPU-based pipelines, including batched processing of frequencies and segments, to provide 300x speed-up over CPU-based inference. The improved inference time allows us to perform detailed ablation studies over several parameters of the GSS algorithm -- such as context duration, number of channels, and noise class, to name a few. We provide end-to-end reproducible pipelines for speaker-attributed transcription of popular meeting benchmarks: LibriCSS, AMI, and AliMeeting. Our code and recipes are publicly available: https://github.com/desh2608/gss.
研究动机与目标
- 解决引导源分离(GSS)的高计算成本问题,尽管其性能优异,但该问题限制了其在离线会议转录中的应用。
- 突破基于CPU的GSS推理瓶颈,该方法在使用80个CPU作业处理CHiME-6开发集时,耗时约20小时。
- 支持对关键GSS参数(如上下文时长、通道数量、噪声类别和BSS迭代次数)的详细消融研究。
- 为LibriCSS、AMI和AliMeeting等主要基准提供端到端、可复现的说话人归属ASR处理流程。
- 公开发布实现代码,提供可通过pip安装的包,并提供完整的语音分离、增强和ASR推理配方。
提出的方法
- 将所有GSS计算操作迁移至GPU,包括WPE去混响、基于CACGMM的掩码估计和波束成形,采用跨频率子带和时间段的批量处理。
- 采用受深度学习训练启发的混合CPU-GPU流水线:CPU工作进程负责加载和预处理大型张量,GPU则并行处理批量推理任务。
- 应用多级批量处理——跨频率带、时间段和说话人——以最大化GPU内存利用率和吞吐量。
- 在早期阶段应用WPE进行混响抑制,并利用语音分离信息指导说话人成分估计,避免排列歧义。
- 在STFT域中使用CACGMM(受限自适应复高斯混合模型)实现稀疏感知、说话人特定的掩码估计。
- 通过结合语音分离(含与不含重叠分配)、GSS增强和预训练神经转导器ASR模型的推理,实现全端到端可复现性。

实验结果
研究问题
- RQ1GPU加速对会议转录中GSS推理速度有何影响?
- RQ2关键GSS超参数(如上下文时长、通道数量、噪声类别和BSS迭代次数)对下游ASR性能有何影响?
- RQ3当使用非真值语音分离而非真值分割时,基于GSS的增强性能如何?
- RQ4各GSS组件(如WPE、噪声建模、通道数量)对WER降低的相对贡献如何?
- RQ5GSS能否在真实会议基准(如LibriCSS、AMI和AliMeeting)上实现有效扩展,并保持一致的性能增益?
主要发现
- GPU加速的GSS实现相较于原始基于CPU的实现,在CHiME-6开发集上实现了300倍的速度提升,推理时间从约20小时缩短至约1.3小时。
- 使用七个输入通道而非两个,使LibriCSS的WER相对降低50.4%,AMI的WER相对降低21.8%,表明通道数量具有主导影响。
- 将上下文时长从5秒增加到15秒可改善WER,但进一步扩展会因将目标说话人能量纳入上下文而导致性能下降。
- 超过五次BSS迭代不再带来额外的WER增益,表明五次迭代后收益递减。
- 结合非真值语音分离时,基于GSS的增强在LibriCSS、AMI和AliMeeting上的cpWER分别降低了29.1%、19.5%和19.7%。
- 该方法恢复了接近80%的近讲与远场条件下WER差距,证明其在真实会议场景中具有强大的鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。