Skip to main content
QUICK REVIEW

[论文解读] DrNAS: Dirichlet Neural Architecture Search

Xiangning Chen, Ruochen Wang|arXiv (Cornell University)|Jun 18, 2020
Advanced Neural Network Applications参考文献 45被引用 7
一句话总结

DrNAS 提出了一种可微神经架构搜索方法,将架构混合权重建模为狄利克雷分布的随机变量,通过路径梯度实现端到端优化,并借助受控的随机性提升泛化性能。该方法在移动设置下于 CIFAR-10 上实现 2.46% 的测试误差,于 ImageNet 上实现 23.7% 的 top-1 错误率,达到当前最先进性能;同时,渐进式学习方案消除了大规模任务中搜索与评估阶段的差距。

ABSTRACT

This paper proposes a novel differentiable architecture search method by formulating it into a distribution learning problem. We treat the continuously relaxed architecture mixing weight as random variables, modeled by Dirichlet distribution. With recently developed pathwise derivatives, the Dirichlet parameters can be easily optimized with gradient-based optimizer in an end-to-end manner. This formulation improves the generalization ability and induces stochasticity that naturally encourages exploration in the search space. Furthermore, to alleviate the large memory consumption of differentiable NAS, we propose a simple yet effective progressive learning scheme that enables searching directly on large-scale tasks, eliminating the gap between search and evaluation phases. Extensive experiments demonstrate the effectiveness of our method. Specifically, we obtain a test error of 2.46% for CIFAR-10, 23.7% for ImageNet under the mobile setting. On NAS-Bench-201, we also achieve state-of-the-art results on all three datasets and provide insights for the effective design of neural architecture search algorithms.

研究动机与目标

  • 解决现有可微 NAS 方法在直接通过点估计优化架构混合权重时存在的不稳定性和泛化能力差的问题。
  • 通过将混合权重建模为具有内在随机性的随机变量,提升架构搜索空间中的探索能力。
  • 通过在全规模数据集上直接进行搜索,消除大规模 NAS 中搜索与评估阶段之间的差异。
  • 开发一种内存高效、可扩展的 NAS 框架,在无需代理任务或降低网络容量的情况下保持高性能。

提出的方法

  • 通过将连续混合权重建模为狄利克雷分布的随机变量,将架构搜索问题转化为分布学习问题。
  • 使用路径梯度估计器,实现狄利克雷参数与梯度优化的端到端联合优化。
  • 在狄利克雷浓度参数上引入距离正则化项,以平衡探索与利用。
  • 推导出理论边界,表明约束目标隐式控制了验证误差的海森矩阵范数,从而提升稳定性和泛化能力。
  • 提出一种渐进式学习方案,保持全规模超网络,并在各阶段逐步增加通道比例。
  • 基于学习到的分布应用操作剪枝,以在渐进训练过程中保持内存效率。

实验结果

研究问题

  • RQ1通过狄利克雷分布将架构混合权重建模为随机变量,能否提升可微 NAS 中的泛化能力与稳定性?
  • RQ2狄利克雷分布带来的随机性如何影响架构搜索空间中的探索能力?
  • RQ3渐进式学习方案能否在不牺牲大规模数据集性能的前提下,消除搜索与评估阶段之间的差距?
  • RQ4通过距离正则化控制狄利克雷方差,对搜索稳定性与最终架构质量有何影响?
  • RQ5在多种基准测试中,DrNAS 与当前最先进 NAS 方法相比,在准确率、方差与可扩展性方面表现如何?

主要发现

  • DrNAS 在 CIFAR-10 上实现 2.46% 的测试误差,优于先前的 SOTA 方法。
  • 在移动设置下的 ImageNet 上,DrNAS 达到 23.7% 的 top-1 错误率,超过先前 SOTA 的 24.0%。
  • 在 NAS-Bench-201 上,DrNAS 在所有三个数据集(CIFAR-10、CIFAR-100 和 ImageNet-16-120)上均创下新 SOTA 结果,且方差较低。
  • 该方法展示了有效的探索到利用的过渡:随时间推移,采样架构的准确率范围逐渐缩小,同时保持高性能。
  • 渐进式学习方案使直接在大规模任务上进行搜索成为可能,无需代理任务,从而消除了搜索与评估之间的差异。
  • 理论分析表明,约束目标隐式正则化了验证误差的海森矩阵,从而增强泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。