Skip to main content
QUICK REVIEW

[论文解读] Structure Learning of Deep Networks via DNA Computing Algorithm

Guoqiang Zhong, Tao Li|arXiv (Cornell University)|Oct 25, 2018
DNA and Biological Computing参考文献 17被引用 4
一句话总结

本文提出一种受DNA计算启发的算法,用于自动学习具有跳跃连接的高性能深度神经网络架构。通过将层编码为短DNA链,并通过碱基配对将网络编码为长DNA链,该方法探索了灵活的架构空间,在MNIST上达到99.73%的准确率,在CIFAR-10上达到95.10%,并表明早停机制在少数训练周期后即可有效剔除表现较差的模型。

ABSTRACT

Convolutional Neural Network (CNN) has gained state-of-the-art results in many pattern recognition and computer vision tasks. However, most of the CNN structures are manually designed by experienced researchers. Therefore, auto- matically building high performance networks becomes an important problem. In this paper, we introduce the idea of using DNA computing algorithm to automatically learn high-performance architectures. In DNA computing algorithm, we use short DNA strands to represent layers and long DNA strands to represent overall networks. We found that most of the learned models perform similarly, and only those performing worse during the first runs of training will perform worse finally than others. The indicates that: 1) Using DNA computing algorithm to learn deep architectures is feasible; 2) Local minima should not be a problem of deep networks; 3) We can use early stop to kill the models with the bad performance just after several runs of training. In our experiments, an accuracy 99.73% was obtained on the MNIST data set and an accuracy 95.10% was obtained on the CIFAR-10 data set.

研究动机与目标

  • 为解决手动设计高性能卷积神经网络(CNN)架构所面临的挑战,该过程耗时且需要专业知识。
  • 探索一种更具灵活性的架构搜索空间,支持任意层之间的跳跃连接,克服固定阶段或简单堆叠编码系统存在的局限性。
  • 开发一种基于DNA链的新编码系统,用于表示层与网络,实现对多样化架构的并行探索。
  • 通过基于早期性能的早停机制,减少训练时间与计算成本,快速剔除表现不佳的模型。

提出的方法

  • 层被编码为包含层类型和跳跃连接信息的短DNA链,每条链代表神经网络中的一个独立层。
  • 通过碱基配对将短DNA链组合成长链,形成完整的网络架构,模拟神经网络组件的组装过程。
  • DNA计算过程并行生成大量候选架构(长DNA链),类似于在“DNA溶液”中进行生化反应。
  • 每个候选架构在数据集上进行训练,其在验证集上的表现决定其适应度,同时采用早停机制在少数训练周期后剔除表现不佳的模型。
  • 搜索空间由包含跳跃连接的架构定义,支持灵活的深度、池化层数量以及任意层间连接。
  • 该方法通过计算模拟实现,使用数据增强和标准训练协议在MNIST和CIFAR-10上评估性能。

实验结果

研究问题

  • RQ1DNA计算能否有效用于探索和生成具有跳跃连接的高性能深度神经网络架构?
  • RQ2与固定阶段或简单堆叠方法相比,所提出的基于DNA的编码系统是否能实现更灵活、更少约束的架构搜索空间?
  • RQ3基于早期训练性能的早停机制是否能可靠地识别并剔除表现不佳的模型,且对最终准确率影响最小?
  • RQ4DNA计算搜索空间中的模型在性能上表现出多大程度的相似性?这是否表明局部极小值在训练深度网络时并非主要障碍?
  • RQ5非专家是否能通过此自动化架构搜索方法在基准数据集上获得具有竞争力的性能?

主要发现

  • 所提出的DNA计算算法成功生成了高性能模型,在MNIST数据集上达到99.73%的测试准确率。
  • 在CIFAR-10数据集上,最佳模型达到95.10%的测试准确率,表现出与最先进方法相当的竞争力。
  • 搜索空间中的大多数模型表现相似,仅有极少数从一开始就持续表现不佳。
  • 在10、20或45个周期后,基于预设准确率阈值的早停机制能有效剔除表现不佳的模型,对整体准确率影响极小。
  • 结果表明,当采用此搜索策略时,局部极小值在训练深度网络过程中并非显著问题。
  • 该方法在更少的训练迭代次数内实现高准确率,显著降低计算成本,同时保持模型性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。