Skip to main content
QUICK REVIEW

[论文解读] Private Language Model Adaptation for Speech Recognition

Zhe Liu, Ke Li|arXiv (Cornell University)|Sep 28, 2021
Privacy-Preserving Technologies in Data参考文献 29被引用 4
一句话总结

本文提出一种基于联邦学习(FL)的方法,用于在自动语音识别(ASR)中对神经网络语言模型(NNLM)进行私有化适应,利用标记级别的置信度分数来缓解设备端转录假设中的错误。通过根据置信度分数加权交叉熵损失,该方法在两个评估集上分别实现了相对2.6%和10.8%的词错误率(WER)降低,提升了ASR准确率,同时保护了用户隐私。

ABSTRACT

Speech model adaptation is crucial to handle the discrepancy between server-side proxy training data and actual data received on local devices of users. With the use of federated learning (FL), we introduce an efficient approach on continuously adapting neural network language models (NNLMs) on private devices with applications on automatic speech recognition (ASR). To address the potential speech transcription errors in the on-device training corpus, we perform empirical studies on comparing various strategies of leveraging token-level confidence scores to improve the NNLM quality in the FL settings. Experiments show that compared with no model adaptation, the proposed method achieves relative 2.6% and 10.8% word error rate (WER) reductions on two speech evaluation datasets, respectively. We also provide analysis in evaluating privacy guarantees of our presented procedure.

研究动机与目标

  • 解决在设备端ASR系统中,服务器端训练数据与真实用户语音之间存在的领域偏移问题。
  • 通过联邦学习(FL)实现在设备端对NNLM进行私有化适应,无需暴露原始用户数据。
  • 通过使用标记级别的置信度分数,缓解ASR生成假设中的转录错误,从而提升适应质量。
  • 通过Rényi微分隐私(RDP)评估所提出的基于FL的适应方法的隐私保障。
  • 证明基于置信度的损失加权优于在可能存在错误的转录数据上进行的朴素训练。

提出的方法

  • 该方法使用联邦学习,在设备端利用用户生成的语音转录文本微调预训练的NNLM,模型更新在中央服务器聚合。
  • 在设备端,ASR系统为用户语音生成假设,这些假设被用作NNLM的无监督训练数据。
  • 一个置信度分类器估计ASR假设中每个标记的正确性概率,提供逐标记的置信度分数。
  • 通过使用这些置信度分数对交叉熵损失进行加权,修改NNLM的训练目标,以降低低置信度标记的影响。
  • 该方法支持语音级和标记级两种置信度加权策略,以提升对转录错误的鲁棒性。
  • 隐私分析采用Rényi微分隐私(RDP),在模型聚合过程中使用L2梯度裁剪和高斯噪声注入。

实验结果

研究问题

  • RQ1联邦学习能否在不暴露原始数据的情况下,有效适应神经网络语言模型以匹配用户特定的语音领域?
  • RQ2在存在ASR转录错误的情况下,不同的基于置信度的加权策略(如标记级与语音级)如何影响NNLM的适应质量?
  • RQ3使用置信度分数对端到端ASR系统中的最终词错误率(WER)有何影响?
  • RQ4在基于FL的NNLM适应设置中,通过Rényi微分隐私衡量的隐私保障与模型性能之间如何权衡?

主要发现

  • 与未适应的模型相比,所提出的方法在对话评估集上实现了相对2.6%的WER降低,在语音命令集上实现了10.8%的WER降低。
  • 标记级别的置信度加权优于所有其他策略,在两个数据集上均取得了最佳的WER表现。
  • 基于置信度的硬阈值处理语音样本在短语音命令集上表现最佳,而标记级加权在较长对话中表现更优。
  • 在FL设置中从零开始训练相比从预训练模型微调,导致约1%的WER性能下降,表明预训练具有显著优势。
  • 即使在强隐私约束下(ε ≈ 0.9),适应后的模型在WER上仍优于未适应的服务器预训练模型,尽管性能增益有所降低。
  • 基于Rényi DP的隐私分析确认,该方法提供了有意义的隐私保障,ε值范围从0.9到248.6,具体取决于噪声水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。