Skip to main content
QUICK REVIEW

[论文解读] Searching for Stage-wise Neural Graphs In the Limit

Xin Zhou, Dejing Dou|arXiv (Cornell University)|Dec 30, 2019
Neural Networks and Applications参考文献 38被引用 4
一句话总结

本文提出使用图翁(graphons)——随机图的连续极限对象——作为神经架构搜索(NAS)的新型搜索空间,实现了可扩展的、理论基础坚实的分阶段神经网络架构搜索。通过利用图翁理论和切距离度量,该方法在CIFAR-10上高效搜索小规模图,并将其扩展为可处理ImageNet的大规模架构,在准确率上优于DenseNet和Watts-Strogatz随机图。

ABSTRACT

Search space is a key consideration for neural architecture search. Recently, Xie et al. (2019) found that randomly generated networks from the same distribution perform similarly, which suggests we should search for random graph distributions instead of graphs. We propose graphon as a new search space. A graphon is the limit of Cauchy sequence of graphs and a scale-free probabilistic distribution, from which graphs of different number of nodes can be drawn. By utilizing properties of the graphon space and the associated cut-distance metric, we develop theoretically motivated techniques that search for and scale up small-capacity stage-wise graphs found on small datasets to large-capacity graphs that can handle ImageNet. The scaled stage-wise graphs outperform DenseNet and randomly wired Watts-Strogatz networks, indicating the benefits of graphon theory in NAS applications.

研究动机与目标

  • 为解决传统NAS中效率低下和冗余的问题,将搜索方式从离散图搜索转变为概率分布搜索。
  • 克服固定大小、手工设计的单元结构的局限性,实现可扩展的、分阶段的架构设计。
  • 开发一种理论基础坚实的可扩展方法,利用图翁理论将小型高性能分阶段图扩展为大规模模型。
  • 证明基于图翁的架构在准确率和泛化能力上优于DenseNet和随机WS网络等现有基线模型。

提出的方法

  • 提出图翁作为在切距离度量下图的柯西序列的连续极限对象,从而构建统一且表达能力强的搜索空间。
  • 利用切距离度量衡量图之间的相似性,并在扩展过程中确保理论收敛性。
  • 采用k重放大方法,在保持结构和性能特性的同时,将小型高性能分阶段图扩展为更大规模。
  • 应用一维线性插值和分数倍放大技术处理中间规模图,同时提供切距离误差的理论边界。
  • 在CIFAR-10上进行小规模NAS以发现最优图翁基分阶段结构,随后将其扩展为ImageNet规模的模型。
  • 通过在相同训练和超参数设置下对比扩展后的架构与DenseNet及WS随机图,验证该方法的有效性。

实验结果

研究问题

  • RQ1图翁能否作为NAS中比离散图更高效、更具表达力的搜索空间?
  • RQ2如何可靠地将小型高性能分阶段图扩展为大规模架构,同时保持其性能?
  • RQ3切距离度量是否能为扩展过程中的图相似性测量与控制提供理论上的坚实基础?
  • RQ4基于图翁的架构能否在准确率和泛化能力上优于DenseNet和WS网络等成熟基线模型?
  • RQ5分数倍放大方法在图结构保持方面的理论误差边界是什么?

主要发现

  • 基于图翁的方法成功地将CIFAR-10上的小型高性能分阶段图扩展至ImageNet规模,准确率优于DenseNet和WS随机图。
  • k重放大方法在切距离意义上对原图的近似效果优于一维线性插值。
  • 分数倍放大引入有界误差,当增加一半节点时,最坏情况下的切距离偏差不超过βΔ/6。
  • 该方法表明,网络性能的关键因素在于底层随机图分布而非确切图结构,验证了向分布级搜索转变的有效性。
  • 基于图翁的架构在多个数据集和评估指标上持续优于基线模型,证实了理论框架的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。