Skip to main content
QUICK REVIEW

[论文解读] Reducing Bias in Production Speech Models

Eric Battenberg, Rewon Child|arXiv (Cornell University)|May 11, 2017
Speech Recognition and Synthesis参考文献 17被引用 11
一句话总结

本文提出了一套技术以减少端到端流式语音识别模型中的偏差,包括用于输入归一化的PCEN、延迟约束的双向RNN(LC-BGRU)、用于改进标签建模的GramCTC,以及对齐感知训练。这些方法在不增加模型大小或部署成本的前提下,将WER降低了高达20%,同时保持低延迟,显著提升了在远场语音和命名实体等困难数据上的泛化能力。

ABSTRACT

Replacing hand-engineered pipelines with end-to-end deep learning systems has enabled strong results in applications like speech and object recognition. However, the causality and latency constraints of production systems put end-to-end speech models back into the underfitting regime and expose biases in the model that we show cannot be overcome by "scaling up", i.e., training bigger models on more data. In this work we systematically identify and address sources of bias, reducing error rates by up to 20% while remaining practical for deployment. We achieve this by utilizing improved neural architectures for streaming inference, solving optimization issues, and employing strategies that increase audio and label modelling versatility.

研究动机与目标

  • 识别并缓解在模型规模扩大后仍会降低性能的端到端流式语音识别模型中的偏差源。
  • 提升模型在分布外和低资源语音数据(如远场语音和命名实体)上的泛化能力。
  • 在实现与更大规模非流式模型相当的性能的同时,保持低推理延迟。
  • 通过基于对齐的优化技术和混合损失函数,解决CTC训练中的优化不稳定性问题。
  • 开发一种实用且可部署的模型架构,在真实场景中优于标准端到端系统。

提出的方法

  • 引入PCEN(通道能量归一化)作为固定对数谱图预处理的可学习替代方案,提升输入表示的鲁棒性。
  • 采用延迟约束的双向门控循环单元(LC-BGRU),在保持低延迟的同时,实现在流式推理中使用未来上下文信息。
  • 采用GramCTC,一种修改后的CTC目标函数,通过重构标签空间以减少条件独立性假设,提升对罕见或未见词形的处理能力。
  • 使用交叉熵(CE)与CTC损失的联合训练,利用对齐信息稳定优化过程并加速收敛。
  • 应用冲击响应(IR)数据增强,提升对远场和噪声环境的鲁棒性。
  • 将这些组件整合为模块化流水线,支持逐步评估与部署。

实验结果

研究问题

  • RQ1如何在不依赖固定手工设计特征的前提下,减少语音模型中的输入表示偏差?
  • RQ2在不违反延迟约束的前提下,能在多大程度上将未来上下文信息融入流式ASR模型中?
  • RQ3重新思考标签空间和损失函数,能否减少CTC中由条件独立性假设引入的偏差?
  • RQ4如对齐感知训练等优化技术,如何影响基于CTC模型的收敛性和泛化能力?
  • RQ5数据增强策略能否提升对未见或罕见语音模式(如姓名和远场语音)的泛化能力?

主要发现

  • PCEN、LC-BGRU与IR增强(Mix-2)的组合在开发集上将WER相对基线降低了8.56%,即使在使用语言模型时也优于双向基线模型。
  • 采用CE与CTC联合训练的模型(Mix-1)在训练集上达到最低WER,但表现出过拟合迹象,且在使用语言模型时泛化能力较差。
  • Mix-3结合PCEN、LC-BGRU与CE/CTC联合训练,在整体开发集上将WER降低至15.74%,相比基线相对减少15.2%。
  • Mix-3模型在具有挑战性的远场子集上达到26.49%的WER,相比基线相对提升24.4%,展现出强大的泛化能力。
  • Mix-3模型的第98百分位服务延迟为153ms,仅略高于基线(112ms),证明了其实际可部署性。
  • 尽管参数量与基线相同,Mix-3仍优于参数量翻倍的模型,表明偏差减少比单纯扩大模型规模更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。