[论文解读] Efficient Fine-Tuning of BERT Models on the Edge
本文提出了一种名为冻结并重构(FAR)的新方法,通过选择性地冻结参数并重构模型架构,实现对边缘设备上类似 BERT 模型的内存高效微调,从而减少激活和梯度的内存使用。在仅导致 GLUE 和 SQuAD 基准测试平均性能下降 1% 的前提下,FAR 将 DistilBERT 的微调时间减少了 30%,内存访问时间减少了 47%。
Resource-constrained devices are increasingly the deployment targets of machine learning applications. Static models, however, do not always suffice for dynamic environments. On-device training of models allows for quick adaptability to new scenarios. With the increasing size of deep neural networks, as noted with the likes of BERT and other natural language processing models, comes increased resource requirements, namely memory, computation, energy, and time. Furthermore, training is far more resource intensive than inference. Resource-constrained on-device learning is thus doubly difficult, especially with large BERT-like models. By reducing the memory usage of fine-tuning, pre-trained BERT models can become efficient enough to fine-tune on resource-constrained devices. We propose Freeze And Reconfigure (FAR), a memory-efficient training regime for BERT-like models that reduces the memory usage of activation maps during fine-tuning by avoiding unnecessary parameter updates. FAR reduces fine-tuning time on the DistilBERT model and CoLA dataset by 30%, and time spent on memory operations by 47%. More broadly, reductions in metric performance on the GLUE and SQuAD datasets are around 1% on average.
研究动机与目标
- 解决在资源受限的边缘设备上对大型类似 BERT 模型进行设备内微调的挑战。
- 降低微调过程中的内存和计算开销,该开销显著高于推理阶段,主要源于激活和梯度的存储需求。
- 实现在动态环境中无需依赖云端重训练,即可在设备上对预训练语言模型进行实际的自适应调整。
- 在大幅降低边缘硬件上训练资源消耗的同时,保持高模型性能。
- 开发一种结构化的、高效的参数冻结策略,避免剪枝方法中常见的非结构化内存访问模式。
提出的方法
- 提出一种基于 L1-范数的新度量方法,用于识别具有高学习潜力的参数组,以实现选择性微调。
- 提出一种动态架构重构机制,将冻结和非冻结参数分组排列,以提升内存访问的局部性。
- 实施两阶段流程:第一阶段为预训练(学习潜力节点的初始化),第二阶段为基于保留百分比的选择性权重更新。
- 采用 1% 的预训练比例以最小化训练开销,同时通过保留百分比(如 10%、40%)控制效率与准确率之间的权衡。
- 选择性地对非关键层或节点应用参数冻结,避免整层冻结以保留模型容量。
- 通过重构模型参数布局优化内存访问模式,减少缓存未命中和主存带宽使用。
实验结果
研究问题
- RQ1选择性参数冻结结合架构重构是否能显著降低在边缘设备上进行 BERT 微调时的内存使用?
- RQ2在不造成显著性能下降的前提下,微调时间和内存访问开销最多可降低多少?
- RQ3预训练和保留百分比的选择如何影响压缩 BERT 模型微调中效率与准确率之间的权衡?
- RQ4与 BitFit 和随机节点选择等现有基线方法相比,所提方法在效率和性能方面是否更具优势?
- RQ5该方法是否可推广至其他压缩模型(如 DistilBERT)并适用于 GLUE 和 SQuAD 等多样化 NLP 任务?
主要发现
- 在 CoLA 数据集上使用 10% 保留率和 1% 预训练比例微调 DistilBERT 时,FAR 将微调时间减少 30%,内存访问时间减少 47%。
- 当保留率为 40% 时,FAR 相较基线实现微调时间减少 17%,内存访问时间减少 36%。
- 在 GLUE 和 SQuAD 基准测试中,平均性能下降仅为 1%,其中 FAR 在 40% 保留率下性能下降最小(0.74%)。
- FAR 在复杂任务(如 SQuAD 2.0)上显著优于随机节点选择和 BitFit,后者在该任务上 F1 分数下降超过 10%。
- 即使在激进的参数冻结策略下,该方法仍能保持高性能,表明过参数化模型允许实现选择性且高效的微调。
- 消融实验证实,预训练和结构化重构至关重要,因为在相同资源约束下,随机选择和 BitFit 的结果显著更差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。