[论文解读] DAAS: Differentiable Architecture and Augmentation Policy Search
DAAS 提出了一种基于双层优化的可微分联合搜索框架,用于神经网络架构与数据增强策略的联合优化。该方法采用 Gumbel-softmax 进行架构搜索,通过基于策略梯度的二阶近似方法进行增强策略搜索。在仅使用 1 个 GPU 天的计算资源下,DAAS 在 CIFAR-10 上实现了 97.91% 的准确率,在 ImageNet 上实现了 76.6% 的 top-1 准确率,相较于之前的方法在 CIFAR-10 上最高提升 0.5%,在 ImageNet 上最高提升 1.0%,得益于联合优化机制。
Neural architecture search (NAS) has been an active direction of automatic machine learning (Auto-ML), aiming to explore efficient network structures. The searched architecture is evaluated by training on datasets with fixed data augmentation policies. However, recent works on auto-augmentation show that the suited augmentation policies can vary over different structures. Therefore, this work considers the possible coupling between neural architectures and data augmentation and proposes an effective algorithm jointly searching for them. Specifically, 1) for the NAS task, we adopt a single-path based differentiable method with Gumbel-softmax reparameterization strategy due to its memory efficiency; 2) for the auto-augmentation task, we introduce a novel search method based on policy gradient algorithm, which can significantly reduce the computation complexity. Our approach achieves 97.91% accuracy on CIFAR-10 and 76.6% Top-1 accuracy on ImageNet dataset, showing the outstanding performance of our search algorithm.
研究动机与目标
- 为解决 NAS 与 AA 独立优化的局限性,即固定增强策略可能对架构评估造成偏差。
- 揭示神经网络架构与数据增强策略之间的耦合关系,表明最优增强策略随架构变化而变化。
- 提出一种联合搜索框架,同时优化架构与增强策略以提升性能。
- 通过引入基于策略梯度的二阶近似方法,克服先前可微分自动增强方法中梯度近似偏差的问题。
- 证明联合搜索相比独立优化 NAS 与 AA 显著提升模型准确率。
提出的方法
- 构建一个双层优化问题,通过交替更新架构参数(利用 Gumbel-softmax 重参数化)与增强参数(通过基于策略梯度的二阶近似方法)。
- 提出一种新颖的基于策略梯度的方法,用于估计不可微增强参数的梯度,避免了先前方法中梯度近似偏差的问题。
- 通过在每次训练迭代中采样超网络边的子集,采用内存高效的 NAS 策略,降低计算成本。
- 采用可微分的搜索空间,结合基于 DARTS 的架构搜索与丰富的增强策略空间(包括操作类型、幅度和应用概率)。
- 在 NAS 与 AA 的内层优化循环中均采用二阶近似,实现端到端的基于梯度的优化。
- 采用两阶段训练流程:第一阶段为架构与增强策略的联合搜索;第二阶段为在默认策略与搜索所得策略下,对发现的模型进行完整训练,以验证性能。
实验结果
研究问题
- RQ1神经架构与数据增强策略的联合优化是否能带来优于独立优化的模型性能?
- RQ2与先前方法中存在偏差的梯度近似相比,基于策略梯度的二阶近似能否提升自动增强的准确率与效率?
- RQ3当在自身搜索所得的增强策略下评估时,NAS 模型的性能相较于使用固定默认策略有何变化?
- RQ4最优数据增强策略在多大程度上依赖于特定的神经网络架构?
- RQ5联合搜索框架是否能在极低计算成本(如 1 个 GPU 天)下实现最先进准确率?
主要发现
- DAAS 在 CIFAR-10 上实现 97.91% 的 top-1 准确率,在 ImageNet 上实现 76.6% 的 top-1 准确率,分别较之前 NAS 方法最高提升 0.5% 和 1.0%。
- 在 CIFAR-10 上,联合搜索框架相比独立搜索平均提升 0.2%(top-1 错误率从 2.24% 降至 2.38%)。
- 当使用搜索所得的增强策略训练时,架构性能最高可提升 0.5%,表明策略与架构之间的耦合至关重要。
- 基于策略梯度的自动增强方法在 4 个基准测试上优于先前的可微分 AA 方法,甚至优于原始 AA 方法(Cubuk et al., 2019),且搜索成本低于 1 个 GPU 天。
- 消融实验表明,单独发现的架构与策略组合(非配对)性能劣于其匹配的组合,证实了联合发现的价值。
- 所提方法通过基于策略梯度简化二阶偏导数的计算,降低了计算成本,同时避免了先前方法中梯度近似偏差的问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。