[论文解读] On-Device Personalization of Automatic Speech Recognition Models for Disordered Speech
本文提出了一种针对发音障碍语音的设备端个性化自动语音识别(ASR)方法,仅需每位说话人50段简短语音。通过在移动设备上直接微调预适应的种子模型,该方法在不上传私人语音数据的前提下,实现了71%的中位相对词错误率降低,并将语音控制家庭自动化任务的成功率从40%提升至81%。
While current state-of-the-art Automatic Speech Recognition (ASR) systems achieve high accuracy on typical speech, they suffer from significant performance degradation on disordered speech and other atypical speech patterns. Personalization of ASR models, a commonly applied solution to this problem, is usually performed in a server-based training environment posing problems around data privacy, delayed model-update times, and communication cost for copying data and models between mobile device and server infrastructure. In this paper, we present an approach to on-device based ASR personalization with very small amounts of speaker-specific data. We test our approach on a diverse set of 100 speakers with disordered speech and find median relative word error rate improvement of 71% with only 50 short utterances required per speaker. When tested on a voice-controlled home automation platform, on-device personalized models show a median task success rate of 81%, compared to only 40% of the unadapted models.
研究动机与目标
- 为解决标准ASR模型在发音障碍语音(尤其是共济失调、唇腭裂或严重言语障碍患者)上的表现不佳问题。
- 通过避免服务器端数据传输,实现在设备端进行个性化以保护用户隐私。
- 通过在移动设备上本地执行模型适应,减少训练时间和通信成本。
- 评估在真实世界语音控制应用中,使用最少数据(仅50段语音)进行设备端训练的有效性。
- 通过支持实时模型更新并减少手动转录校正,改善数据收集过程中的用户体验。
提出的方法
- 该方法采用经过设备端推理优化的改进型RNN-T架构,包含8层LSTM编码器和2层语言模型,每30ms处理一次128维的对数梅尔特征。
- 采用两阶段适应:首先使用在多样化发音障碍语音上预训练的种子模型作为起点;其次在设备端进行微调,仅更新前五个编码器层以避免过拟合。
- 设备端训练采用迭代方式进行——每5段语音后执行一次——通过用户在保存前校正转录文本的反馈回路,实现连续的模型更新。
- 该方法使用量化且紧凑的模型,以实现高效的设备端推理与训练,模型检查点在会话间保存并重新加载。
- 种子模型通过在大量发音障碍语音数据上微调基础ASR模型生成,以在说话人特定适应前提升初始准确率。
- 训练过程设计为省电且内存占用低,模型更新在每批5段语音后触发,以最小化用户等待时间。
实验结果
研究问题
- RQ1仅使用50段简短语音,设备端ASR个性化是否能显著提升发音障碍说话人的识别准确率?
- RQ2与单批训练相比,通过连续更新(每5段语音后更新一次)的设备端训练是否能减少用户在转录校正中的工作量?
- RQ3与从在正常语音上训练的基础模型开始相比,使用预先适应发音障碍语音的种子模型在词错误率降低和训练效率方面表现如何?
- RQ4设备端个性化在多大程度上能提升真实世界应用的成功率,例如语音控制家庭自动化?
- RQ5严重言语障碍用户是否能在实际中有效使用设备端个性化,实现转录准确率的可测量提升?
主要发现
- 仅使用50段语音进行设备端个性化,与在正常语音上训练的基础模型相比,中位词错误率(WER)降低了71%。
- 语音控制家庭自动化任务的中位成功率从40%(未适应模型)提升至81%(设备端个性化模型)。
- 连续训练(每5段语音后更新模型)使训练数据上的中位WER相比单批训练降低了27%,其中中度言语障碍者受益最大(降低31%)。
- 使用种子模型使中位WER从26.2降至15.2,转录校正需求减少42%,实现相对改进。
- 在一名严重言语障碍(失聪)患者上的真实世界测试显示,转录准确率从种子模型的48%提升至在Pixel 3手机上设备端训练后的63%。
- 整个流程(包括录制和训练50段语音)在移动设备上耗时不足一小时,每次训练周期持续4至5分钟。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。