[论文解读] Data Distillation for Text Classification
本文提出了一种用于文本分类的新型数据蒸馏方法,通过优化数值表示以模仿大规模原始数据集的知识,生成合成的小规模训练数据。采用通过蒸馏数据进行梯度反向传播的迭代优化方案,该方法仅使用原始训练数据量的0.1%即可达到原始模型约90%的准确率。
Deep learning techniques have achieved great success in many fields, while at the same time deep learning models are getting more complex and expensive to compute. It severely hinders the wide applications of these models. In order to alleviate this problem, model distillation emerges as an effective means to compress a large model into a smaller one without a significant drop in accuracy. In this paper, we study a related but orthogonal issue, data distillation, which aims to distill the knowledge from a large training dataset down to a smaller and synthetic one. It has the potential to address the large and growing neural network training problem based on the small dataset. We develop a novel data distillation method for text classification. We evaluate our method on eight benchmark datasets. The results that the distilled data with the size of 0.1% of the original text data achieves approximately 90% performance of the original is rather impressive.
研究动机与目标
- 为解决在大规模文本数据集上训练大型深度学习模型所产生的高计算与存储成本问题。
- 探索数据蒸馏作为模型蒸馏的正交替代方案,重点在于压缩训练数据而非模型架构。
- 生成保留原始数据集核心知识的合成小规模训练数据,以实现高效模型训练。
- 通过将大规模数据集的知识蒸馏到紧凑的合成数据中,提升训练效率并减少冗余。
- 在极小数据条件下,于多种文本分类基准上评估该方法的有效性。
提出的方法
- 该方法为每类初始化少量可学习的数值张量形式的合成文本样本(即蒸馏数据)。
- 采用交替优化过程:在蒸馏数据上训练学生模型,并将原始数据损失的梯度反向传播至更新蒸馏数据。
- 通过可微分优化更新蒸馏数据,利用Hessian-向量积高效计算二阶梯度。
- 该过程迭代优化合成数据,使其更准确地逼近原始数据集的决策边界与表征。
- 最终生成的蒸馏数据可作为标准训练数据用于任何下游模型训练,实现快速高效的模型学习。
- 该方法确保优化过程对合成数据可微,从而实现从原始数据损失到蒸馏数据参数的梯度流动。
实验结果
研究问题
- RQ1能否从大规模文本数据集中蒸馏出的小型合成数据集,实现与完整数据集相近的分类性能?
- RQ2在模型准确率与训练效率方面,数据蒸馏相较于随机采样或启发式选择训练数据有何差异?
- RQ3在保持模型泛化能力的前提下,蒸馏数据能在多大程度上减少训练时间与计算成本?
- RQ4蒸馏数据大小对模型性能有何影响?其性能是否趋近于完整数据的性能上限?
- RQ5优化过程是否能通过基于梯度的精炼,有效实现从原始数据集到合成数据的知识迁移?
主要发现
- 在仅占原始数据集0.1%规模的情况下,蒸馏数据在八个基准文本分类任务中均实现了约90%的完整数据集性能。
- 平均而言,蒸馏数据在相同规模下显著优于随机选择的子集,各数据集的准确率提升范围为10至30个百分点。
- 在蒸馏数据上训练的模型收敛更快,且更早达到更高准确率,表明其优化路径更平滑。
- 对于每类样本极少的数据集(如AG’s News每类仅30个样本),蒸馏数据仍能实现有效学习,在AG’s News上达到85.64%准确率,而随机数据仅为71.33%。
- 当蒸馏数据规模从原始数据的0.01%增至0.1%时,模型准确率持续提升并趋近于完整数据的性能,显示出良好的可扩展性。
- 该方法表明,通过生成合成数据可超越子集选择的性能上限,因为其捕捉到了单个子集中不存在的知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。