[论文解读] Delta Keyword Transformer: Bringing Transformers to the Edge through Dynamically Pruned Multi-Head Self-Attention
该论文提出了一种动态的、基于阈值的剪枝方法——Delta Keyword Transformer,通过利用序列数据中的时间稳定性,减少Transformer中多头自注意力(MHSA)的计算量。通过仅保留连续标记之间显著的特征差异(即delta值),该方法在不损失准确率的情况下,将乘加操作(MACs)减少高达80%,在仅损失1–4%准确率的情况下,减少高达94%,从而实现了在边缘设备上的高效部署。
Multi-head self-attention forms the core of Transformer networks. However, their quadratically growing complexity with respect to the input sequence length impedes their deployment on resource-constrained edge devices. We address this challenge by proposing a dynamic pruning method, which exploits the temporal stability of data across tokens to reduce inference cost. The threshold-based method only retains significant differences between the subsequent tokens, effectively reducing the number of multiply-accumulates, as well as the internal tensor data sizes. The approach is evaluated on the Google Speech Commands Dataset for keyword spotting, and the performance is compared against the baseline Keyword Transformer. Our experiments show that we can reduce ~80% of operations while maintaining the original 98.4% accuracy. Moreover, a reduction of ~87-94% operations can be achieved when only degrading the accuracy by 1-4%, speeding up the multi-head self-attention inference by a factor of ~7.5-16.
研究动机与目标
- 解决Transformer中多头自注意力(MHSA)计算成本过高的问题,该问题限制了其在资源受限的边缘设备上的部署。
- 克服现有剪枝方法需要微调或专用硬件的局限性。
- 通过在推理过程中减少MAC操作,无需微调,实现在微型机器学习(tinyML)设备上的实时、低功耗推理。
- 利用序列标记之间的delta计算,在推理时实现细粒度、动态的剪枝。
- 在大幅降低计算复杂度的同时,保持边缘设备上关键词检测任务的高准确率。
提出的方法
- 通过计算输入序列中连续标记对应特征之间的delta差异,对MHSA组件应用基于阈值的剪枝。
- 仅保留并处理高于预设阈值的非零delta值,丢弃不显著的变化,以减少MAC操作。
- 为每个MHSA组件设置独立的阈值:输入投影(XW)、查询-键点积(QK^T)、Softmax输出以及最终头投影(W_P)。
- 在推理时动态剪枝,无需微调,从而可立即应用于预训练模型。
- 利用序列数据中的时间冗余性——尤其在静音或稳定音频段中,大多数delta值为零——实现高比例压缩。
- 采用轻量级的比较机制,无需额外硬件或复杂训练,适用于边缘设备部署。
实验结果
研究问题
- RQ1动态的、基于阈值的MHSA剪枝是否能在不微调或准确率下降的情况下降低计算成本?
- RQ2基于delta的剪枝在利用序列数据的时间稳定性方面,对边缘推理的效率如何?
- RQ3在不同剪枝阈值下,计算节省与准确率损失之间的权衡关系如何?
- RQ4该方法是否可普遍应用于预训练Transformer中的不同层和不同输入类型?
- RQ5在关键词检测任务中,可在多大程度上减少MAC操作,同时保持高准确率?
主要发现
- 该方法在不造成准确率下降的情况下,将MHSA中的MAC操作最多减少80%,在Google语音命令数据集上保持98.4%的准确率。
- 当准确率仅下降1%时,实现了7.5倍的推理加速,对应MACs减少86.73%–93.65%。
- 当准确率下降1–4%时,推理速度最高可提升16倍,表明其在性能与计算量之间具有出色的权衡能力。
- 对于静音("_silence_")关键词实例,该方法实现了97%–99.9%的操作减少,原因在于输入特征几乎恒定。
- 部分配置甚至略微优于原始KWT-3模型(准确率分别为98.46%、98.48%、98.42%),同时显著降低计算量。
- 平均而言,各层中70%–77%的MHSA操作被跳过,头投影最多可丢弃87%,QK^T操作最多可丢弃95%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。