[论文解读] Low-rank Adaptation of Large Language Model Rescoring for Parameter-Efficient Speech Recognition
该论文提出LoRB,一种用于在语音识别重新评分中微调基于BERT的模型的参数高效低秩微调(LoRA)方法。通过冻结所有预训练参数并插入可训练的低秩矩阵(占总参数的0.08%),LoRB在实现与全量微调相当的性能的同时,训练速度最快可达6倍,显存占用降低32%,并通过判别性训练目标和基于相关性的正则化方法保持了在不同领域的泛化能力。
We propose a neural language modeling system based on low-rank adaptation (LoRA) for speech recognition output rescoring. Although pretrained language models (LMs) like BERT have shown superior performance in second-pass rescoring, the high computational cost of scaling up the pretraining stage and adapting the pretrained models to specific domains limit their practical use in rescoring. Here we present a method based on low-rank decomposition to train a rescoring BERT model and adapt it to new domains using only a fraction (0.08%) of the pretrained parameters. These inserted matrices are optimized through a discriminative training objective along with a correlation-based regularization loss. The proposed low-rank adaptation Rescore-BERT (LoRB) architecture is evaluated on LibriSpeech and internal datasets with decreased training times by factors between 5.4 and 3.6.
研究动机与目标
- 解决在语音识别重新评分中微调大语言模型(LLM)带来的高计算成本问题。
- 在仅进行极少参数更新且无推理延迟的前提下,实现预训练BERT模型的领域自适应。
- 通过减轻低秩微调中常见的性能下降问题,提升在未见领域的泛化能力。
- 在显著减少训练时间和显存使用的情况下,实现具有竞争力的自动语音识别性能。
- 评估LoRA在不同模型规模、数据规模和秩配置下的重新评分任务中的可扩展性行为。
提出的方法
- 通过在每个Transformer层中插入一对低秩矩阵,将LoRA应用于BERT,这些矩阵在其余所有参数冻结的情况下进行训练。
- 采用判别性训练目标,以最小化词错误率(WER),直接优化语音识别性能。
- 引入基于相关性的正则化损失,以稳定表示学习并防止在域外泛化中的性能退化。
- 该方法应用于第二轮重新评分,即使用微调后的BERT模型对N-best假设列表进行重打分。
- 在LibriSpeech和内部数据集上,针对多个领域和模型规模(5M、170M、1B参数)进行了评估。
- 由于训练稳定性提升,采用更大的初始学习率,从而在初始收敛较慢的情况下实现更快的收敛速度。

实验结果
研究问题
- RQ1低秩微调是否能在仅进行极少参数更新的前提下,实现与全量微调在基于BERT的语音识别重新评分中相当的性能?
- RQ2所提出的基于相关性的正则化方法是否相比标准LoRA能提升在域外测试集上的泛化能力?
- RQ3在不同模型规模和数据规模下,LoRA的训练速度和显存使用量与全量微调相比如何?
- RQ4LoRA在重新评分任务中,其性能随模型规模、数据规模和秩配置的可扩展性行为如何?
- RQ5当仅使用少量领域内数据对特定领域进行微调时,LoRA是否能保持在非目标领域的性能?
主要发现
- 与全量微调相比,LoRB在非目标领域(Shopping)实现了+0.23%的相对WER提升,同时仅更新了0.08%的参数。
- 与全量微调相比,LoRB将训练时间减少了3.6至5.4倍,当使用更大的学习率时,最快可实现6倍加速。
- LoRB将训练期间的GPU显存占用从87%降低至52%,显著提升了训练效率。
- LoRB与全量微调之间的性能差距从170M参数时的-22.3%相对WER缩小至1B参数时的+2.4%,表明在更大模型上具有更好的可扩展性。
- LoRB在数据规模上表现出对数尺度的扩展曲线,当训练语料超过15万条后收益递减,而全量微调则呈现线性扩展趋势。
- LoRB在更大主干模型上表现出更快的收敛速度,使用1B参数BERT时,收敛速度最快可达2.74倍。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。