Skip to main content
QUICK REVIEW

[论文解读] An Investigation Into On-device Personalization of End-to-end Automatic Speech Recognition Models

Khe Chai Sim, Petr Zadrazil|arXiv (Cornell University)|Sep 14, 2019
Speech Recognition and Synthesis被引用 5
一句话总结

本文研究了使用RNN-T架构在移动设备上对端到端自动语音识别(ASR)模型进行设备端个性化的方法,直接在移动设备上训练个性化模型,以保护数据隐私并实现可扩展性。通过使用滑动窗口数据消耗模型模拟移动设备训练约束,并分割梯度计算,该方法在语音障碍用户中实现了58.1%的相对词错误率(WER)降低——尽管相比服务器端训练存在18.7%的WER退化——提供了一种安全且可扩展的替代服务器端个性化的方法。

ABSTRACT

Speaker-independent speech recognition systems trained with data from many users are generally robust against speaker variability and work well for a large population of speakers. However, these systems do not always generalize well for users with very different speech characteristics. This issue can be addressed by building personalized systems that are designed to work well for each specific user. In this paper, we investigate the idea of securely training personalized end-to-end speech recognition models on mobile devices so that user data and models never leave the device and are never stored on a server. We study how the mobile training environment impacts performance by simulating on-device data consumption. We conduct experiments using data collected from speech impaired users for personalization. Our results show that personalization achieved 63.7\\% relative word error rate reduction when trained in a server environment and 58.1% in a mobile environment. Moving to on-device personalization resulted in 18.7% performance degradation, in exchange for improved scalability and data privacy. To train the model on device, we split the gradient computation into two and achieved 45% memory reduction at the expense of 42% increase in training time.

研究动机与目标

  • 研究在移动设备上直接训练个性化端到端ASR模型的可行性及其性能权衡,以避免将用户数据发送至服务器。
  • 评估移动设备训练约束(如内存、存储和数据访问受限)对ASR模型性能的影响,与服务器端训练进行对比。
  • 开发并基准测试设备端训练技术,包括数据窗口化和梯度计算分割,以在保持模型准确率的同时减少内存使用。
  • 评估仅使用设备端数据和计算对语音障碍用户进行ASR模型个性化的效果。

提出的方法

  • 使用滑动窗口机制模拟设备端数据消耗,其中训练数据存储在有限大小(Nw)的缓存中,并在多个训练会话(Ns)中重复使用。
  • 将梯度计算分为两部分以减少设备端训练期间的内存使用,代价是训练时间增加。
  • 使用少量语音障碍用户收集的特定用户语音数据,对RNN-T模型的特定组件(尤其是编码器层)进行微调。
  • 使用在多样化说话者上预训练的基线RNN-T模型,并通过在设备上微调,采用不同层次的层适应程度(例如第1–7层或全部8个编码器层)。
  • 使用词错误率(WER)衡量性能,并通过在Pixel 3设备上测量每句语音的内存使用和时间来跟踪训练效率。
  • 通过改变窗口大小(Nw)、会话数量(Ns)和有效训练轮数,进行消融实验,以隔离数据重用频率对模型性能的影响。

实验结果

研究问题

  • RQ1在受限数据缓存和有限内存条件下,设备端训练对个性化ASR模型的WER性能影响如何,与服务器端训练相比如何?
  • RQ2设备端训练中数据重用的最优策略是什么?其对模型收敛性和准确率的影响如何?
  • RQ3在设备端训练中,梯度计算分割能在多大程度上减少内存使用?其带来的训练时间增加代价如何?
  • RQ4对于具有非典型语音特征的用户(如语音障碍个体),设备端个性化在多大程度上有效?

主要发现

  • 设备端个性化相比基线模型实现了58.1%的相对WER降低,而服务器环境为63.7%,表明由于移动设备限制导致18.7%的WER退化。
  • 将数据窗口大小(Nw)从100增加到500,使WER性能从19.6%降低至15.3%,相对提升22.0%,而仅增加训练会话数(Ns)不再带来进一步增益。
  • 分割梯度计算使内存使用减少45%(从1,187MB降至649MB),适用于较小模型,代价是每句语音的训练时间增加42%。
  • 表现最佳的配置——对第1–7层编码器进行微调,Nw=500,Ns=10——实现了14.8%的WER,相比基线模型有58.1%的相对改进。
  • 在Pixel 3设备上,每轮训练(Nw=500,批量大小=10)约需3.5小时,全尺寸模型每句语音处理时间为12.5秒。
  • 结果表明,设备端个性化在技术上是可行且有效的,尽管性能略有折损,但仍能提供显著的隐私保护和可扩展性优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。