[论文解读] Multi-objective Neural Architecture Search via Non-stationary Policy Gradient
该论文提出NPG-NAS,一种基于非平稳策略梯度的强化学习框架,可高效近似多目标神经架构搜索中的完整Pareto前沿。通过引入自适应奖励函数(ADF与ADC)以及余弦温度衰减以实现探索,该方法实现了快速收敛与高精度,在CIFAR-10、CIFAR-100和ImageNet上均优于现有方法,展现出更优的Pareto覆盖范围与最先进的性能,且模型参数量更小。
Multi-objective Neural Architecture Search (NAS) aims to discover novel architectures in the presence of multiple conflicting objectives. Despite recent progress, the problem of approximating the full Pareto front accurately and efficiently remains challenging. In this work, we explore the novel reinforcement learning (RL) based paradigm of non-stationary policy gradient (NPG). NPG utilizes a non-stationary reward function, and encourages a continuous adaptation of the policy to capture the entire Pareto front efficiently. We introduce two novel reward functions with elements from the dominant paradigms of scalarization and evolution. To handle non-stationarity, we propose a new exploration scheme using cosine temperature decay with warm restarts. For fast and accurate architecture evaluation, we introduce a novel pre-trained shared model that we continuously fine-tune throughout training. Our extensive experimental study with various datasets shows that our framework can approximate the full Pareto front well at fast speeds. Moreover, our discovered cells can achieve supreme predictive performance compared to other multi-objective NAS methods, and other single-objective NAS methods at similar network sizes. Our work demonstrates the potential of NPG as a simple, efficient, and effective paradigm for multi-objective NAS.
研究动机与目标
- 为解决在多目标神经架构搜索(NAS)中高效且准确地近似完整Pareto前沿的挑战。
- 克服标量化方法与进化方法的局限性,后者需要多次运行或面临高昂的搜索成本与偏差问题。
- 开发一种统一的基于强化学习的框架,使策略在单次训练过程中动态适应,以探索多样化的Pareto最优架构。
- 通过持续微调的预训练共享模型,提升架构评估的速度与精度。
提出的方法
- 提出两种新颖的非平稳奖励函数:ADF(基于目标的偏好度)用于渐进式标量化,ADC(基于Pareto支配关系)用于Pareto前沿的带状扩展。
- 采用非平稳策略梯度框架,其中奖励函数随时间演化,以引导策略的持续适应。
- 在非平稳训练过程中应用余弦温度衰减结合学习率 warm restarts,以平衡探索与利用。
- 使用一个预训练的共享模型,每次采样架构后即刻进行持续微调,以实现快速且准确的验证精度估计。
- 利用控制器策略在基于单元的搜索空间中生成架构,奖励基于Pareto支配关系或标量化目标。
- 支持端到端训练,使策略学习生成逐步占据或逼近真实Pareto前沿的架构。
实验结果
研究问题
- RQ1非平稳策略梯度框架是否能在单次训练中有效近似多目标NAS中的完整Pareto前沿?
- RQ2所提出的ADF与ADC奖励函数在Pareto前沿覆盖范围与多样性方面,相较于传统标量化方法与进化方法表现如何?
- RQ3余弦温度衰减结合warm restarts在非平稳强化学习用于NAS时,对探索能力的提升程度如何?
- RQ4与从零开始训练相比,使用持续微调的预训练共享模型进行架构评估,在速度与精度上表现如何?
- RQ5通过NPG-NAS发现的架构在下游任务(如ImageNet迁移学习)中是否具备良好的泛化能力?
主要发现
- ADF-L在CIFAR-100上达到83.99%的准确率,参数量仅573万,相比DenseNet-BC减少77.61%的参数。
- ADC-L10与ADF-L100在ImageNet上的top-1准确率高于DPP-Net-PNAS,但参数量仅为后者的1/10。
- NPG-NAS将CIFAR-10与CIFAR-100的细胞迁移到ImageNet,实现76.67%的top-1准确率,参数量789万,优于同类规模下的大多数NAS方法。
- 与随机搜索(RS)相比,该框架实现了更均匀且更扩展的Pareto前沿,尤其在ADC中表现更优,具有更广的范围与更高的多样性。
- 预训练共享模型使模型在仅50步内即实现快速收敛,并在搜索阶段与独立训练阶段的准确率之间展现出高度相关性(由强验证准确率体现)。
- 在三目标CIFAR-10上,ADF与ADC优于RS,且与M-DF性能相当,其中ADC在Pareto前沿右侧区域展现出更广的覆盖范围。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。