[论文解读] Multi-fidelity Neural Architecture Search with Knowledge Distillation
该论文提出MF-KD,一种多保真度神经架构搜索方法,通过在早期阶段架构排名中使用知识蒸馏(KD)损失进行训练,提升了低保真度评估的准确性。通过将基于KD的低保真度评估整合到使用共克里金法的贝叶斯多保真度优化框架中,MF-KD在NAS-Bench-201上实现了最先进性能,在CIFAR-10、CIFAR-100和ImageNet-16-120上均优于BOHB和Regularized Evolution等基线方法,计算预算为12,000秒。
Neural architecture search (NAS) targets at finding the optimal architecture of a neural network for a problem or a family of problems. Evaluations of neural architectures are very time-consuming. One of the possible ways to mitigate this issue is to use low-fidelity evaluations, namely training on a part of a dataset, fewer epochs, with fewer channels, etc. In this paper, we propose a bayesian multi-fidelity method for neural architecture search: MF-KD. The method relies on a new approach to low-fidelity evaluations of neural architectures by training for a few epochs using a knowledge distillation. Knowledge distillation adds to a loss function a term forcing a network to mimic some teacher network. We carry out experiments on CIFAR-10, CIFAR-100, and ImageNet-16-120. We show that training for a few epochs with such a modified loss function leads to a better selection of neural architectures than training for a few epochs with a logistic loss. The proposed method outperforms several state-of-the-art baselines.
研究动机与目标
- 通过加速低保真度评估来解决神经架构搜索(NAS)的高计算成本,同时不牺牲架构选择质量。
- 提升早期(低保真度)与最终(高保真度)性能指标之间的相关性,以实现在搜索过程中更准确的架构排序。
- 开发一种利用知识蒸馏增强低保真度评估可靠性的多保真度贝叶斯优化框架。
- 证明仅训练几个周期的KD训练方法在计算资源极少的情况下,其架构选择效果优于标准交叉熵训练。
- 在多个基准数据集上,于固定计算预算下实现最先进水平的NAS性能。
提出的方法
- 提出一种新颖的低保真度评估策略:仅使用知识蒸馏(KD)损失进行1个周期的神经架构训练,而非标准交叉熵损失。
- 使用特征图蒸馏(NST损失)对齐学生网络与教师网络在中间层的激活,提升泛化能力与早期性能预测准确性。
- 将基于KD的低保真度评估整合到使用共克里金回归的贝叶斯多保真度优化框架中,以建模不同保真度水平。
- 采用高斯过程回归与共克里金法联合建模低保真度与高保真度性能,实现高效采集函数优化。
- 使用具有共享权重的超网络,以在搜索过程中实现高效训练与评估。
- 通过期望改进(EI)采集函数优化搜索过程,在架构空间中实现探索与利用的平衡。
实验结果
研究问题
- RQ1与标准交叉熵训练相比,知识蒸馏是否能提升神经架构搜索中低保真度评估的质量?
- RQ2使用基于KD的早期训练是否能提升低保真度与高保真度性能指标之间的相关性?
- RQ3在相同计算预算下,结合KD增强的低保真度评估的多保真度贝叶斯优化框架是否能超越现有最先进NAS方法?
- RQ4所提出的MF-KD方法在多种数据集(包括CIFAR-10、CIFAR-100和ImageNet-16-120)上是否具有鲁棒性?
- RQ5在早期训练中使用KD是否能带来优于标准训练或其他多保真度基线方法的架构发现效果?
主要发现
- 在CIFAR-10上,MF-KD实现了93.93%的测试准确率,显著优于第二名方法(Regularized Evolution的93.92%),且p值<0.05,具有统计显著性。
- 在CIFAR-100上,MF-KD达到72.00%的准确率,优于BOHB(70.85%)和教师ResNet(70.86%),并位列搜索空间前0.2%。
- 在ImageNet-16-120上,MF-KD达到45.67%的准确率,超过BOHB(44.42%)和ResNet教师模型(44.63%),位列搜索空间前0.5%。
- 与标准交叉熵训练相比,使用NST损失训练1个周期的评估,使低保真度与高保真度评估之间的Kendall-tau等级相关性提升了12.5%。
- 消融研究证实,多保真度优化与基于KD的低保真度评估均对性能提升有贡献,尤其在CIFAR-100和ImageNet-16-120等复杂数据集上表现显著。
- 该方法在所有三个基准上发现的架构测试准确率均高于教师网络(ResNet),证明了KD在模型压缩之外的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。