[论文解读] Geometry-Aware Gradient Algorithms for Neural Architecture Search
该论文提出几何感知指数算法(GAEA),一种用于神经架构搜索(NAS)的新颖优化框架,将架构参数视为连续单纯形约束空间内的可学习变量。通过利用镜像下降理论和指数梯度更新,GAEA 在 CIFAR-10、CIFAR-100 和 ImageNet 基准上实现了快速收敛、稀疏性以及最先进的准确率,优于先前的方法,包括 DARTS 和 GDAS。
Recent state-of-the-art methods for neural architecture search (NAS) exploit gradient-based optimization by relaxing the problem into continuous optimization over architectures and shared-weights, a noisy process that remains poorly understood. We argue for the study of single-level empirical risk minimization to understand NAS with weight-sharing, reducing the design of NAS methods to devising optimizers and regularizers that can quickly obtain high-quality solutions to this problem. Invoking the theory of mirror descent, we present a geometry-aware framework that exploits the underlying structure of this optimization to return sparse architectural parameters, leading to simple yet novel algorithms that enjoy fast convergence guarantees and achieve state-of-the-art accuracy on the latest NAS benchmarks in computer vision. Notably, we exceed the best published results for both CIFAR and ImageNet on both the DARTS search space and NAS-Bench201; on the latter we achieve near-oracle-optimal performance on CIFAR-10 and CIFAR-100. Together, our theory and experiments demonstrate a principled way to co-design optimizers and continuous relaxations of discrete NAS search spaces.
研究动机与目标
- 解决基于权重共享的 NAS 方法在理论理解不足和泛化能力差的问题。
- 将基于权重共享的 NAS 重新表述为一个单层经验风险最小化问题,将架构参数视为可学习变量而非超参数。
- 通过利用架构参数空间的几何结构,提升 NAS 中的优化性能和泛化能力。
- 基于镜像下降理论,为基于梯度的 NAS 提供有限时间收敛保证。
- 在现代 NAS 基准上实现最先进的准确率,同时提升效率和稀疏性。
提出的方法
- 将架构参数重新参数化以位于概率单纯形上,从而实现结构化优化。
- 采用指数梯度更新——一种镜像下降的变体——专为单纯形约束域设计,以确保快速收敛和稀疏性。
- 将 NAS 表述为一个在包含架构决策作为学习参数的结构化函数类上的单层经验风险最小化问题。
- 对 NAS 目标函数的连续松弛应用块随机镜像下降,证明其可在多项式时间内收敛至驻点。
- 以最小修改将 GAEA 框架集成至现有的一阶 NAS 方法(如 DARTS 和 GDAS)中。
- 采用离散架构搜索空间的连续松弛,允许基于梯度的优化,同时保持架构空间的结构特性。
实验结果
研究问题
- RQ1基于权重共享的 NAS 是否可以被有意义地重新表述为在结构化函数类上的单层优化问题?
- RQ2几何感知优化方法如何改善可微分 NAS 中的收敛性和泛化能力?
- RQ3在架构空间的连续松弛下,基于梯度的 NAS 的理论收敛保证可以如何建立?
- RQ4在单纯形上使用指数梯度更新是否能带来更稀疏、更可解释且性能更高的架构?
- RQ5所提出的框架是否在现代基准(如 NAS-Bench-201 和 DARTS 搜索空间)上优于现有最先进 NAS 方法?
主要发现
- 在 NAS-Bench-201 基准上,GAEA 在 CIFAR-10 上实现了 94.10% ± 0.29 的新 SOTA 准确率,较之前最佳结果提升 0.18%。
- 在 CIFAR-100 上,GAEA 达到 73.43% ± 0.13 的准确率,较 prior 最佳结果提升 1.59%。
- 在 ImageNet-16-120 上,GAEA 达到 46.36% ± 0.00 的准确率,超过之前最佳结果 0.82%。
- GAEA DARTS(ERM)在 CIFAR-10 上达到 94.10% ± 0.29,显著优于双层 DARTS 基线。
- 该方法在 NAS-Bench-201 上表现出近乎最优的性能,CIFAR-100 上达到 73.43%,ImageNet-16-120 上达到 46.36%。
- 理论分析建立了块随机镜像下降的多项式时间驻点收敛性,为基于梯度的 NAS 提供了首个有限时间收敛保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。