[论文解读] Particle Swarm Optimisation for Evolving Deep Neural Networks for Image Classification by Evolving and Stacking Transferable Blocks
该论文提出EPSOCNN,一种高效的粒子群优化方法,通过在CIFAR-10的小型子集上演化单个可迁移的密集块,并将其堆叠形成深层CNN用于图像分类。通过利用DenseNet架构的专业知识缩小搜索空间并结合迁移学习,EPSOCNN仅用10块GPU训练9小时即实现了最先进(SOTA)的准确率,且所演化出的块在CIFAR-100和SVHN上也表现出良好的泛化能力。
Deep Convolutional Neural Networks (CNNs) have been widely used in image classification tasks, but the process of designing CNN architectures is very complex, so Neural Architecture Search (NAS), automatically searching for optimal CNN architectures, has attracted more and more research interests. However, the computational cost of NAS is often too high to apply NAS on real-life applications. In this paper, an efficient particle swarm optimisation method named EPSOCNN is proposed to evolve CNN architectures inspired by the idea of transfer learning. EPSOCNN successfully reduces the computation cost by minimising the search space to a single block and utilising a small subset of the training set to evaluate CNNs during evolutionary process. Meanwhile, EPSOCNN also keeps very competitive classification accuracy by stacking the evolved block multiple times to fit the whole dataset. The proposed EPSOCNN algorithm is evaluated on CIFAR-10 dataset and compared with 13 peer competitors comprised of deep CNNs crafted by hand, learned by reinforcement learning methods and evolved by evolutionary computation approaches, which shows very promising results by outperforming all of the peer competitors with regard to the classification accuracy, number of parameters and the computational cost.
研究动机与目标
- 降低图像分类任务中神经架构搜索(NAS)的计算成本,同时保持高分类准确率。
- 通过从小型训练子集演化出单个可复用的CNN块,实现迁移学习。
- 通过逐步堆叠演化出的块来提升模型容量,而无需重新运行完整的NAS过程。
- 评估演化块在无关但相似的数据集(如CIFAR-100和SVHN)上的可迁移性。
- 证明人类设计的架构知识(如DenseNet)可有效约束搜索空间,实现高效的进化搜索。
提出的方法
- 通过利用手工设计CNN的先验知识,仅编码单个DenseNet块的超参数(即层数和增长率),从而最小化搜索空间。
- 使用粒子群优化(PSO)演化DenseNet块的超参数,适应度在CIFAR-10训练数据的小型子集(10%)上进行评估。
- 在PSO过程中应用Adam优化,以减少小训练子集带来的偏差,并提高收敛稳定性。
- 演化完成后,将性能最佳的块堆叠三次,形成可拟合完整CIFAR-10数据集的深层网络。
- 最终模型通过使用学习率调度策略的SGD进行微调,以提升测试准确率。
- 所演化出的块在不重新训练NAS过程的前提下被迁移至CIFAR-100和SVHN,验证了其可迁移性。
实验结果
研究问题
- RQ1在小型子集上训练的单个演化CNN块,能否在完整规模的图像分类任务中实现良好泛化?
- RQ2将搜索空间最小化为单个可迁移块,是否能显著降低计算成本而不牺牲准确率?
- RQ3多次堆叠演化出的块是否能有效扩展模型容量,同时保持性能?
- RQ4与手工设计、强化学习(RL)和进化计算(EC)方法相比,所提出的基于PSO的NAS方法在准确率、模型大小和搜索成本方面表现如何?
- RQ5在CIFAR-10上演化出的块在其他数据集(如CIFAR-100和SVHN)上可迁移的程度如何,能否实现有竞争力的性能?
主要发现
- EPSOCNN在CIFAR-10上的测试错误率为4.47%,优于13种同行竞争模型(包括手工设计、RL和EC方法)。
- 该方法仅用10块GPU训练9小时即完成最终架构的演化,相比以往NAS方法显著降低了计算成本。
- 所演化块在CIFAR-100上的测试错误率为20.81%,在SVHN上的测试错误率为5.83%,在两个数据集上均优于所有同行竞争者。
- 由三个堆叠的演化块组成的最终模型在不同数据集上表现出强大的泛化能力和鲁棒性。
- PSO算法收敛迅速,第12代即达到稳定性能,表明其具有良好的探索能力并有效避免了早熟收敛。
- 学生t检验证实EPSOCNN与所有同行竞争者之间的性能差异具有统计显著性,验证了结果的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。