Skip to main content
QUICK REVIEW

[论文解读] Understanding the wiring evolution in differentiable neural architecture search

Sirui Xie, Shoukang Hu|arXiv (Cornell University)|Sep 2, 2020
Neural Networks and Applications被引用 5
一句话总结

本文研究了可微神经架构搜索(NAS)中的隐式偏差,这些偏差倾向于偏好特定的连接拓扑结构。通过将NAS重新表述为每条边的局部代价最小化问题,作者揭示了代价分配机制与训练动态——尤其是在双层优化中——引入了强烈的归纳偏差,抑制了拓扑多样性,导致更宽、更简单的架构被优先选择,而非更深的架构。

ABSTRACT

Controversy exists on whether differentiable neural architecture search methods discover wiring topology effectively. To understand how wiring topology evolves, we study the underlying mechanism of several existing differentiable NAS frameworks. Our investigation is motivated by three observed searching patterns of differentiable NAS: 1) they search by growing instead of pruning; 2) wider networks are more preferred than deeper ones; 3) no edges are selected in bi-level optimization. To anatomize these phenomena, we propose a unified view on searching algorithms of existing frameworks, transferring the global optimization to local cost minimization. Based on this reformulation, we conduct empirical and theoretical analyses, revealing implicit inductive biases in the cost's assignment mechanism and evolution dynamics that cause the observed phenomena. These biases indicate strong discrimination towards certain topologies. To this end, we pose questions that future differentiable methods for neural wiring discovery need to confront, hoping to evoke a discussion and rethinking on how much bias has been enforced implicitly in existing NAS methods.

研究动机与目标

  • 理解可微NAS方法为何在拓扑搜索过程中始终偏好更宽而非更深的架构。
  • 研究导致观察到的连接拓扑演化模式(如边剪枝后选择性恢复)的潜在机制。
  • 揭示现有NAS框架中隐含的归纳偏差,这些偏差可能扭曲最优神经架构拓扑的搜索过程。
  • 挑战‘所发现的拓扑结构反映全局最优’的假设,表明其实际受训练方案约束的影响。
  • 鼓励重新评估NAS中的双层优化与权重共享策略,以减少架构搜索中的非预期偏差。

提出的方法

  • 将可微NAS重新表述为每条边的局部代价最小化问题,从而能够对单个边的行为进行分析和实证研究。
  • 引入一种可扩展的蒙特卡洛估计器来近似边的代价,提供搜索过程中拓扑演化的微观视角。
  • 分析代价分配机制,并与NAS中标准的基于梯度的参数反向传播进行对比。
  • 理论与实证分析将代价动态与代理损失联系起来,揭示训练动态如何影响拓扑选择。
  • 通过分类损失 $L_{\bm{\theta}}$ 和熵 $H_{\bm{\theta}}$ 比较训练集与搜索集的行为,以检测过拟合与不确定性校准不足。
  • 以双层优化为案例研究,展示由于代价发散和对验证集的虚假置信,导致拓扑发现出现灾难性失败。

实验结果

研究问题

  • RQ1为何可微NAS方法尽管在表达能力上理论等价,仍偏好更宽的架构而非更深的架构?
  • RQ2为何在搜索过程中观察到边先被剪枝后又选择性恢复的演化模式?
  • RQ3NAS中的代价分配机制与标准的基于梯度的参数更新有何不同?它们引入了何种偏差?
  • RQ4为何双层优化无法发现有意义的连接拓扑?过拟合与不确定性校准不足在其中扮演何种角色?
  • RQ5所发现的架构在多大程度上是训练方案的产物,而非全局最优?

主要发现

  • 可微NAS中的代价分配机制与标准反向传播有本质不同,引入了隐式偏差,使某些拓扑结构更受青睐。
  • 在双层优化中,搜索集中错误预测的代价值显著更正(2.18 vs. 0.80),表明拓扑发现出现灾难性失败。
  • 在搜索集上训练的子网络表现出更高的分类损失($L_{\text{wrong}} = 2.92$)和更低的熵($H_{\text{wrong}} = 0.74$),表明存在过度自信与误分类。
  • 训练过程中代价从正值降至负值,促进拓扑增长;然而在双层优化中,这一趋势被逆转或中止,导致无法选择任何边。
  • 对宽度的偏好并非源于其内在优越性,而是源于基础架构与训练方案中的归纳偏差。
  • 最终架构并非全局最优,而是由代价动态、归一化与权重共享的相互作用所塑造,这引发了对当前NAS评估公平性的质疑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。