[论文解读] KNAS: Green Neural Architecture Search
KNAS 提出了一种绿色神经架构搜索方法,通过利用梯度核假设,在无需训练的情况下评估神经网络架构——具体而言,使用梯度的格拉姆矩阵的均值(MGM)作为下游性能的代理指标。该方法在搜索速度上实现数量级的提升,同时在文本分类任务中表现优于 RoBERTA-large,显著降低了计算与环境成本。
Many existing neural architecture search (NAS) solutions rely on downstream training for architecture evaluation, which takes enormous computations. Considering that these computations bring a large carbon footprint, this paper aims to explore a green (namely environmental-friendly) NAS solution that evaluates architectures without training. Intuitively, gradients, induced by the architecture itself, directly decide the convergence and generalization results. It motivates us to propose the gradient kernel hypothesis: Gradients can be used as a coarse-grained proxy of downstream training to evaluate random-initialized networks. To support the hypothesis, we conduct a theoretical analysis and find a practical gradient kernel that has good correlations with training loss and validation performance. According to this hypothesis, we propose a new kernel based architecture search approach KNAS. Experiments show that KNAS achieves competitive results with orders of magnitude faster than "train-then-test" paradigms on image classification tasks. Furthermore, the extremely low search cost enables its wide applications. The searched network also outperforms strong baseline RoBERTA-large on two text classification tasks. Codes are available at \url{https://github.com/Jingjing-NLP/KNAS} .
研究动机与目标
- 解决现有神经架构搜索(NAS)方法因依赖完整训练进行架构评估而带来的高计算与环境成本问题。
- 探究随机初始化网络的梯度是否可作为下游训练性能的可靠代理。
- 开发一种无需训练的绿色 NAS 解决方案,在保持竞争性模型准确率的同时消除搜索阶段的训练过程。
- 在包括图像分类与文本分类在内的多样化任务中,验证所提方法的泛化能力。
提出的方法
- 提出梯度核假设:随机初始化网络的梯度可作为下游训练性能的粗粒度代理。
- 识别梯度的格拉姆矩阵(GM)为关键特征,其弗罗贝尼乌斯范数(Frobenius norm)可界定优化过程的收敛速率。
- 引入格拉姆矩阵的均值(MGM)作为实际且可扩展的架构评估指标。
- 利用 MGM 对架构进行无训练排序,仅选择前 k 个候选架构进行完整训练。
- 将该方法应用于图像分类任务的 NAS-Bench-201,以及基于 RoBERTA 的文本分类任务搜索空间。
- 开展理论分析,表明 MGM 越高,收敛速度越快,泛化能力越强。
实验结果
研究问题
- RQ1随机初始化网络的梯度是否能可靠预测下游训练性能?
- RQ2梯度的格拉姆矩阵(GM)是否与训练损失和验证准确率呈现强相关性?
- RQ3基于 MGM 的无训练架构评估方法是否能与完整训练的 NAS 方法在性能上相媲美?
- RQ4所提出的 KNAS 方法是否在不同任务(如图像分类与文本分类)中具有泛化能力?
- RQ5该方法对搜索效率与碳足迹减少的影响如何?
主要发现
- 在 CIFAR-100 上,MGM 与负向训练损失的斯皮尔曼等级相关系数为 0.53(p ≪ 0.01),与验证准确率的相关系数为 0.56(p ≪ 0.01)。
- KNAS 在 NAS-Bench-201 上实现了具有竞争力的准确率,其搜索成本相比完整训练 NAS 降低了数量级。
- 在文本分类任务中,所搜索的架构在 MRPC 上优于 RoBERTA-large 1.24%,在 RTE 上优于 0.24%。
- KNAS 在 MRPC 上的搜索时间仅为 0.4K 秒,在 RTE 上为 2K 秒,展现出极高的效率。
- 该方法在不同初始化方式、归一化类型以及网络架构(如 CNN 与自注意力网络)之间均表现出良好的泛化能力。
- 理论分析证实,GM 矩阵的更高 F-范数对应更快收敛,验证了梯度核假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。