Skip to main content
QUICK REVIEW

[论文解读] VoiceFilter-Lite: Streaming Targeted Voice Separation for On-Device Speech Recognition

Quan Wang, Ignacio López Moreno|arXiv (Cornell University)|Sep 9, 2020
Speech and Audio Processing参考文献 25被引用 10
一句话总结

VoiceFilter-Lite 是一种轻量级、实时的设备端语音分离模型,通过使用说话人嵌入选择性地抑制非目标语音,从而提升自动语音识别(ASR)性能,同时在干净语音和非语音噪声条件下保持高精度。该模型通过非对称损失函数和自适应抑制强度实现这一目标,最终得到一个 2.2 MB、8 位整型模型,在干净语音或非语音噪声条件下无 WER 损失,并在语音重叠条件下实现 27.7% 的相对 WER 改进。

ABSTRACT

We introduce VoiceFilter-Lite, a single-channel source separation model that runs on the device to preserve only the speech signals from a target user, as part of a streaming speech recognition system. Delivering such a model presents numerous challenges: It should improve the performance when the input signal consists of overlapped speech, and must not hurt the speech recognition performance under all other acoustic conditions. Besides, this model must be tiny, fast, and perform inference in a streaming fashion, in order to have minimal impact on CPU, memory, battery and latency. We propose novel techniques to meet these multi-faceted requirements, including using a new asymmetric loss, and adopting adaptive runtime suppression strength. We also show that such a model can be quantized as a 8-bit integer model and run in realtime.

研究动机与目标

  • 开发一种轻量级、设备端的语音分离模型,可在多人说话环境中提升 ASR 性能,同时在干净语音或非语音噪声条件下不降低性能。
  • 实现在资源受限设备上的实时流式推理,CPU、内存和电池使用量最小化。
  • 设计一种系统,直接在 ASR 输入特征(如滤波器组能量)上运行,无需重建音频,从而降低计算开销。
  • 确保模型始终无害——从不损害 ASR 性能——同时在语音重叠场景中提供显著性能提升。
  • 实现可量化的 8 位整型模型,使其在设备上高效运行,延迟低且效率高。

提出的方法

  • 该模型作为逐帧处理的前端处理器,以声学特征(如堆叠的对数梅尔滤波器组能量)为输入,输出增强后的特征,跳过音频重建过程。
  • 使用来自参考语音片段的说话人判别性 d-vector 来调节分离过程,实现目标语音的过滤。
  • 引入非对称 L2 损失函数,在训练中惩罚过度抑制,确保模型在非语音或干净条件下的性能不会下降。
  • 在推理时应用自适应抑制强度,使用移动平均系数(β=0.8),根据输入信号特征动态调整抑制程度。
  • 将模型量化为 8 位整型格式,实现在设备上的高效推理,内存和计算开销极小。
  • 架构避免使用双向 RNN 或时间卷积,以支持低延迟流式推理。

实验结果

研究问题

  • RQ1轻量级、设备端的语音分离模型能否在不降低干净语音或非语音噪声条件下性能的前提下,提升语音重叠场景中的 ASR 性能?
  • RQ2如何训练语音分离模型以避免过度抑制,确保其在各种声学环境下的安全性?
  • RQ3在噪声环境下性能提升与在干净或非语音环境下的鲁棒性之间,最优权衡是什么?
  • RQ4能否设计一种模型,直接在 ASR 输入特征上运行而无需音频重建,从而降低计算成本?
  • RQ5哪些量化和架构选择能够实现在设备上低资源使用、实时、低延迟的推理?

主要发现

  • 在真实语音查询数据集上,VoiceFilter-Lite 模型在添加语音噪声条件下实现了 27.7% 的相对 WER 改进(相对提升 49.0%),在干净语音或非语音噪声条件下无 WER 损失。
  • 与标准 L2 损失相比,使用非对称 L2 损失函数使非语音噪声条件下的 WER 损失降低了 80%,同时在语音重叠场景中保持了强劲的性能提升。
  • 采用 β=0.8 的自适应抑制强度将非语音噪声条件下的 WER 损失降至接近零,同时在语音重叠条件下仍实现显著的性能增益。
  • 该模型可压缩至 2.2 MB,并量化为 8 位整型格式,实现在设备上的实时推理,对 CPU、内存和电池的影响极小。
  • 堆叠滤波器组输入/输出配置通过支持帧子采样降低了 CPU 成本,同时保留了上下文信息并提升了效率。
  • 该模型在不同输入特征类型(FFT 幅度、滤波器组、堆叠滤波器组)下均保持一致的性能,其中堆叠滤波器组因效率更高且上下文保留更优而更受青睐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。