Skip to main content
QUICK REVIEW

[论文解读] Efficient Adapters for Giant Speech Models

Nanxin Chen, Izhak Shafran|arXiv (Cornell University)|Jun 13, 2023
Speech Recognition and Synthesis被引用 4
一句话总结

本文提出了一种新型适配器架构——双并行适配器(TPA),专为基于Conformer的巨型语音模型设计,将并行残差适配器插入每个模块的两个前馈网络中。TPA在仅更新1.4%至11%参数的情况下,实现了与全量微调相当的性能——在50%的语音识别基准测试中达到或超越全量微调表现,同时实现了高效、任务特定的微调,且预训练编码器保持冻结状态。

ABSTRACT

Large pre-trained speech models are widely used as the de-facto paradigm, especially in scenarios when there is a limited amount of labeled data available. However, finetuning all parameters from the self-supervised learned model can be computationally expensive, and becomes infeasiable as the size of the model and the number of downstream tasks scales. In this paper, we propose a novel approach called Two Parallel Adapter (TPA) that is inserted into the conformer-based model pre-trained model instead. TPA is based on systematic studies of the residual adapter, a popular approach for finetuning a subset of parameters. We evaluate TPA on various public benchmarks and experiment results demonstrates its superior performance, which is close to the full finetuning on different datasets and speech tasks. These results show that TPA is an effective and efficient approach for serving large pre-trained speech models. Ablation studies show that TPA can also be pruned, especially for lower blocks.

研究动机与目标

  • 解决大规模预训练语音模型中全量微调带来的计算与存储低效问题。
  • 通过最小化参数更新,克服低资源场景下的灾难性遗忘与过拟合问题。
  • 开发一种通用、高效的微调方法,兼容多种语音任务与多语言设置。
  • 在不重新训练编码器的前提下,实现大规模语音模型在多个下游任务中的可扩展部署。
  • 探究残差适配器的结构与架构因素,设计出可剪枝、高性能的优化变体。

提出的方法

  • 提出双并行适配器(TPA),一种双分支残差适配器,插入每个Conformer模块的两个前馈网络(FFN1与FFN2)中。
  • 采用带有两个全连接层和ReLU激活函数的残差连接,可选地加入层归一化。
  • 在训练过程中保持预训练的Conformer编码器冻结,仅更新TPA与随机初始化的解码器。
  • 对适配器组件(如层归一化、ReLU、深度、宽度)进行系统性消融研究,以识别最优配置。
  • 基于激活统计量,对TPA组件(尤其是低层)实施迭代神经元剪枝。
  • 采用统一框架,使同一冻结编码器通过任务特定的TPA与解码器头服务于多个下游任务。

实验结果

研究问题

  • RQ1双分支适配器架构(TPA)是否能在语音识别与语音翻译任务中超越标准的串行或单分支残差适配器?
  • RQ2TPA的架构设计(如层归一化、宽度、深度)如何影响性能与参数效率?
  • RQ3在不造成性能下降的前提下,TPA在低层与高层模块中可被剪枝的程度有多大?
  • RQ4TPA是否能在多种语音基准测试中仅更新少量参数(远低于2%)的情况下,保持接近全量微调的性能?
  • RQ5TPA是否具备跨多种语音任务(包括多语言ASR与多语言语音翻译)的泛化能力?

主要发现

  • 在CoVoST 2多语言语音翻译任务中,TPA仅更新1.4%的参数,性能与全量微调相差不超过0.9 BLEU。
  • 在LibriSpeech数据集上,TPA在clean集上达到1.9%的WER,在other集上达到3.7%的WER,性能与全量微调相当,且仅更新11%的参数。
  • 在AMI与Switchboard等具有挑战性的数据集上,TPA的性能与全量微调相差不足0.3 WER,尽管仅更新了2%的参数。
  • 消融研究显示,第二FFN模块中高达60–80%的神经元可被剪枝而不影响性能,尤其在低层中效果显著。
  • 剪枝冻结的编码器效果较弱,但第2至10层中20–40%的神经元可被移除而不造成性能下降,表明具有提升推理速度的潜力。
  • TPA优于先前工作中报告的串行与并行适配器变体,展现出更优的参数效率与更高的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。