[论文解读] FitHuBERT: Going Thinner and Deeper for Knowledge Distillation of Speech Self-Supervised Learning
FitHuBERT 提出了一种更薄且更深的学生模型,用于自监督语音学习的知识蒸馏,将 HuBERT 的模型大小减少至 23.8%,推理时间减少 64.1%(提速 2.8 倍),同时在 SUPERB 基准上实现了 SOTA 性能,WER 为 12.1%,PER 为 13.3%,通过基于提示的蒸馏和可学习的时间压缩层实现。
Large-scale speech self-supervised learning (SSL) has emerged to the main field of speech processing, however, the problem of computational cost arising from its vast size makes a high entry barrier to academia. In addition, existing distillation techniques of speech SSL models compress the model by reducing layers, which induces performance degradation in linguistic pattern recognition tasks such as phoneme recognition (PR). In this paper, we propose FitHuBERT, which makes thinner in dimension throughout almost all model components and deeper in layer compared to prior speech SSL distillation works. Moreover, we employ a time-reduction layer to speed up inference time and propose a method of hint-based distillation for less performance degradation. Our method reduces the model to 23.8% in size and 35.9% in inference time compared to HuBERT. Also, we achieve 12.1% word error rate and 13.3% phoneme error rate on the SUPERB benchmark which is superior than prior work.
研究动机与目标
- 解决像 HuBERT 这类大规模自监督语音学习(SSL)模型带来的高计算成本和大模型尺寸问题,这些问题阻碍了其在学术和实际应用中的使用。
- 克服现有蒸馏方法因减少模型深度而导致的语音模式识别任务(如音素识别和自动语音识别)性能下降问题。
- 设计一种在通道维度上更薄但层数更深的学生模型,相较于以往的蒸馏方法,实现更高的参数效率和性能保留。
- 引入一个可学习的时间压缩层,以加速推理过程而不损失准确性。
- 开发一种基于提示的蒸馏方案,将教师模型多个中间层的知识传递给学生模型,以提升学生模型的性能。
提出的方法
- 设计一种通道增加的 CNN 特征提取器,使用逐点卷积以增强特征表示,同时减少参数量。
- 在 Transformer 块中将自注意力机制的维度减少 37.5%,前馈网络内部层的维度减少 84.3%,以构建更薄的模型。
- 保持与教师模型相同的 Transformer 层数(12 层),以保留表征深度,使模型在结构上更深层。
- 通过使用损失函数鼓励对齐,实现基于提示的蒸馏,即匹配教师模型和学生模型的中间层表示(特征)。
- 引入一个可学习的时间压缩层,在推理过程中下采样序列长度,以减少计算负载并加快处理速度。
- 使用逐层预测头以解决蒸馏过程中教师与学生模型之间的维度不匹配问题,确保训练稳定。
实验结果
研究问题
- RQ1更薄且更深的学生架构是否能在语音模式识别任务中,同时优于现有蒸馏方法的模型效率和性能?
- RQ2与仅使用最终层输出的蒸馏相比,使用多个中间层的基于提示的蒸馏是否能显著提升学生模型的性能?
- RQ3可学习的时间压缩层在不降低模型准确性的前提下,能在多大程度上减少推理时间?
- RQ4在参数量、推理速度和 SUPERB 基准下游任务性能方面,该方法与以往蒸馏技术相比表现如何?
- RQ5为何性能退化模式在不同任务中表现不同,尤其是局部任务(如 PR、ASR)与全局任务(如 SID)之间?
主要发现
- FitHuBERT 将模型大小减少至原始 HuBERT 的 23.8%,推理时间相比教师模型减少 64.1%(提速 2.8 倍)。
- 在 SUPERB 基准上,FitHuBERT 实现了 12.1% 的 WER 和 13.3% 的音素错误率(PER),优于包括 DistilHuBERT 在内的先前蒸馏方法。
- 在蒸馏过程中使用全部 12 个提示层的学生模型表现最佳(IC 准确率为 94.20%,WER 为 12.66%),表明多层提示显著提升了知识迁移效果。
- 时间压缩层的下采样比率为 k=1(无压缩)时,性能优于标准的 FitHuBERT-100,表明当推理速度非关键时,可省略时间压缩层。
- 在全局分类任务(如说话人识别,SID)中,性能退化更为明显,表明架构设计可能更偏向于局部语言模式。
- 在 CNN 架构中使用逐点卷积可提升性能,通过实现跨通道特征交互,相比固定通道设计提升了 2.56% 的准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。