[论文解读] Speaker activity driven neural speech extraction
该论文提出 ADEnet,一种神经语音分离模型,利用说话人活动信息作为辅助线索,从单通道混合语音中提取目标语音,无需注册语音或视频。其性能具有竞争力——在自动语音识别(ASR)中相对词错误率(WER)最高可降低25%,尤其在高重叠条件下结合语音分离系统时表现优异,展示了无需注册的实用且灵活的替代方案。
Target speech extraction, which extracts the speech of a target speaker in a mixture given auxiliary speaker clues, has recently received increased interest. Various clues have been investigated such as pre-recorded enrollment utterances, direction information, or video of the target speaker. In this paper, we explore the use of speaker activity information as an auxiliary clue for single-channel neural network-based speech extraction. We propose a speaker activity driven speech extraction neural network (ADEnet) and show that it can achieve performance levels competitive with enrollment-based approaches, without the need for pre-recordings. We further demonstrate the potential of the proposed approach for processing meeting-like recordings, where the speaker activity is obtained from a diarization system. We show that this simple yet practical approach can successfully extract speakers after diarization, which results in improved ASR performance, especially in high overlapping conditions, with a relative word error rate reduction of up to 25%.
研究动机与目标
- 开发一种基于说话人活动的语音分离方法,避免依赖预先录制的注册语音。
- 探究说话人活动信息是否可作为单通道语音分离中实用且有效的辅助线索。
- 评估 ADEnet 与语音分离系统结合在会议类录音中提升 ASR 性能的效果。
- 证明仅依靠说话人活动线索即可实现出色的语音分离效果,即使在语音重叠区域也有效。
提出的方法
- ADEnet 是一种单通道神经网络,输入为语音混合信号和时间同步的说话人活动信号。
- 说话人活动信号以帧为单位指示目标说话人是否处于活动状态,作为提取网络的空间-时间掩码。
- 网络架构采用类似 U-Net 的编码器-解码器结构,并通过跳跃连接保留精细的频谱细节。
- 模型通过端到端训练,损失函数旨在最大化提取语音与参考语音之间的信噪比(SDR)。
- 在真实场景中,说话人活动信号由语音分离系统(如 TS-VAD)生成,支持即插即用的集成方式。
- 该方法对不完美的活动信号具有鲁棒性,即使在噪声或重叠区域存在时,性能仍能保持稳定。
实验结果
研究问题
- RQ1仅依靠说话人活动信息是否可作为无注册语音情况下的有效辅助线索,实现神经语音分离?
- RQ2在理想和噪声活动信号条件下,ADEnet 与基于注册的 SpeakerBeam 方法相比表现如何?
- RQ3在会议类录音中,ADEnet 与语音分离系统结合后,ASR 性能可提升多少?
- RQ4ADEnet 如何处理多个说话人同时活动的重叠语音区域?
主要发现
- 使用理想说话人活动信号时,ADEnet 的信噪比(SDR)达到 10.2 dB,高于 SpeakerBeam 的 9.4 dB,且无需注册语音。
- ADEnet-mix 在噪声训练下优于静音掩码和基线 SpeakerBeam,尤其在噪声或活动信号不完美的条件下表现更优。
- 与语音分离系统(TS-VAD)结合后,ADEnet 在高重叠条件(OV40)下将 cpWER 最多降低 25%,达到 29.8%,而无 ADEnet 时为 33.6%。
- 该方法在不同质量的说话人活动信号下均保持稳定性能,表明对语音分离错误和重叠区域具有鲁棒性。
- ADEnet 可在重叠区域实现有效的单通道语音分离,如提取语音的定性示例所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。