[论文解读] Automated Deep Learning: Neural Architecture Search Is Not the End
本文对自动化深度学习(AutoDL)进行了全面评估,认为尽管神经架构搜索(NAS)具有重要影响,但并非AutoDL的唯一焦点。作者提出了十个评估标准——新颖性、解决方案质量、效率、稳定性、可解释性、可复现性、工程质量、可扩展性、泛化能力与环保性——以评估贯穿深度学习全生命周期的AutoDL研究,主张超越NAS,推动更广泛、更全面的进展。
Deep learning (DL) has proven to be a highly effective approach for developing models in diverse contexts, including visual perception, speech recognition, and machine translation. However, the end-to-end process for applying DL is not trivial. It requires grappling with problem formulation and context understanding, data engineering, model development, deployment, continuous monitoring and maintenance, and so on. Moreover, each of these steps typically relies heavily on humans, in terms of both knowledge and interactions, which impedes the further advancement and democratization of DL. Consequently, in response to these issues, a new field has emerged over the last few years: automated deep learning (AutoDL). This endeavor seeks to minimize the need for human involvement and is best known for its achievements in neural architecture search (NAS), a topic that has been the focus of several surveys. That stated, NAS is not the be-all and end-all of AutoDL. Accordingly, this review adopts an overarching perspective, examining research efforts into automation across the entirety of an archetypal DL workflow. In so doing, this work also proposes a comprehensive set of ten criteria by which to assess existing work in both individual publications and broader research areas. These criteria are: novelty, solution quality, efficiency, stability, interpretability, reproducibility, engineering quality, scalability, generalizability, and eco-friendliness. Thus, ultimately, this review provides an evaluative overview of AutoDL in the early 2020s, identifying where future opportunities for progress may exist.
研究动机与目标
- 超越对神经架构搜索(NAS)的狭隘关注,考察自动化在整个深度学习生命周期中的应用。
- 识别当前AutoDL研究中的关键空白,特别是自动化数据工程、部署和模型维护等领域。
- 提出一个基于十项标准的标准化评估框架,以提升AutoDL研究的严谨性、可复现性与影响力。
- 呼吁研究社区将重点从短期性能提升转向可用性、自主性与长期可持续性。
- 通过解决研究焦点中的人为与系统性偏见,推动AutoDL向更全面、更可持续的方向演进。
提出的方法
- 对贯穿完整深度学习工作流的AutoDL研究进行系统性回顾,涵盖问题定义、数据工程、模型开发、超参数优化、部署与维护等阶段。
- 提出一套全面的十项评估标准——新颖性、解决方案质量、效率、稳定性、可解释性、可复现性、工程质量、可扩展性、泛化能力与环保性——用于评估AutoDL方法。
- 对AutoDL关键子领域的现有方法进行分类:NAS(黑盒、灰盒、白盒)、超参数优化(HPO)、自动化数据工程、硬件搜索、部署感知自动化以及模型维护(如持续学习)。
- 分析各子领域的成熟度与研究密度,识别出如自动化数据工程与持久模型适应等研究不足的领域。
- 运用所提出的评估标准对现有工作进行评估与批判,强调透明度、可复现性与长期可持续性的必要性。
- 倡导研究文化向更广泛、更负责任的自动化转型,充分考虑现实约束与长期系统可行性。

实验结果
研究问题
- RQ1为何在自动化深度学习(AutoDL)研究中仅聚焦于神经架构搜索(NAS)存在关键局限?
- RQ2如何在不依赖模型准确率与基准性能指标的前提下,客观评估AutoDL研究的质量与影响力?
- RQ3深度学习生命周期的哪些阶段在AutoDL中仍缺乏足够关注?原因是什么?
- RQ4当前的AutoDL方法在多大程度上优先考虑了效率、可复现性与可持续性,而不仅仅是性能?
- RQ5研究社区应如何采纳更全面、更负责任的方法来推进AutoDL的开发与评估?
主要发现
- 尽管具有重要影响,神经架构搜索(NAS)并非自动化深度学习(AutoDL)的最终目标,过度依赖NAS会限制更广泛的研究进展。
- 许多AutoDL子领域——如自动化数据工程、硬件搜索与模型维护——尽管在实际部署中至关重要,却仍处于研究不足状态。
- 所提出的十项评估标准(如可解释性、可复现性、环保性)为超越性能指标的AutoDL研究评估提供了稳健框架。
- 白盒超参数优化(HPO)展现出显著的效率潜力,但缺乏严谨的可复现性研究,对其长期有效性提出质疑。
- 部署感知AutoDL的发展程度高于硬件搜索,原因在于硬件缺乏标准化,但两者对现实世界可扩展性均至关重要。
- AutoDL领域受到人为因素的制约,如短期导向、可复现性不足,以及对可持续性与工程质量的忽视,严重阻碍了端到端自动化的实现。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。