[论文解读] How Developers Iterate on Machine Learning Workflows -- A Survey of the Applied Machine Learning Literature
本文通过对五个领域中105篇应用机器学习论文的调查,提供了对迭代式机器学习工作流开发的统计分析。研究发现,开发者频繁迭代学习率和批量大小等超参数,优先考虑模型可解释性和快速训练,并高度依赖汇总评估与细粒度评估方法,为人在回路的机器学习系统设计提供了依据。
Machine learning workflow development is anecdotally regarded to be an iterative process of trial-and-error with humans-in-the-loop. However, we are not aware of quantitative evidence corroborating this popular belief. A quantitative characterization of iteration can serve as a benchmark for machine learning workflow development in practice, and can aid the development of human-in-the-loop machine learning systems. To this end, we conduct a small-scale survey of the applied machine learning literature from five distinct application domains. We collect and distill statistics on the role of iteration within machine learning workflow development, and report preliminary trends and insights from our investigation, as a starting point towards this benchmark. Based on our findings, we finally describe desiderata for effective and versatile human-in-the-loop machine learning systems that can cater to users in diverse domains.
研究动机与目标
- 提供基于统计数据的实证证据,以反驳基于轶事的主张,证明迭代式机器学习工作流开发的存在。
- 识别在社会科学、自然科学、网络应用、自然语言处理和计算机视觉等多样化应用领域中常见的迭代实践。
- 基于观察到的开发者行为,推导出有效的人在回路机器学习平台的系统设计原则。
- 为评估人机协同机器学习系统建立标准化基准的基础。
- 支持开发能够预判并加速迭代式机器学习开发流程的工具。
提出的方法
- 对2016年发表的105篇应用机器学习论文进行了小规模调查,覆盖五个领域:社会科学、自然科学、网络应用、自然语言处理和计算机视觉。
- 收集了关于迭代修改的结构化统计数据,包括数据源、特征、超参数、模型架构和评估方法。
- 通过多位调查员达成共识以确保数据质量,并将聚合后的数据集开源,以支持可复现性和基准开发。
- 通过追踪论文中对超参数、模型类型和预处理步骤的修改,分析了迭代频率和模式。
- 将迭代操作映射到系统设计需求,如支持快速训练、可解释性和细粒度评估。
- 开发了一个框架,通过统计建模推断工作流动态,从已发表文献中估算迭代次数和趋势。
实验结果
研究问题
- RQ1在不同应用领域中,机器学习工作流开发过程中最常见的迭代修改类型是什么?
- RQ2开发者在实践中如何优先排序超参数调优、特征工程和模型架构修改?
- RQ3最常用的评估方法是什么?它们在汇总分析与细粒度分析之间有何差异?
- RQ4哪些系统级特性对于支持观察到的机器学习开发中的迭代行为最为关键?
- RQ5特定领域的需求在多大程度上影响了迭代策略和模型开发模式的选择?
主要发现
- 学习率和批量大小是最常调优的超参数,分别占迭代次数的40.0%和24.2%,表明对训练收敛速度的高度重视。
- 交叉验证和正则化是控制模型复杂度的首选方法,分别在30.0%和40.0%的工作流中使用,以防止过拟合。
- 在所有领域中,开发者均同时使用汇总指标(如准确率、F1分数)和细粒度分析(如案例研究、特征贡献、可视化)进行评估,其中精确率/召回率和准确率最为常见。
- 细粒度分析方法(如案例研究和特征贡献)在17.1%至25.7%的论文中被使用,凸显了可解释性和调试的重要性。
- 深度神经网络架构修改在计算机视觉领域中常见,而核函数选择在SVM系统中常见,显示出领域特定的调优偏好。
- 最受欢迎的模型调优操作是学习率(在自然语言处理中占41.2%)、批量大小(在计算机视觉中占30.8%)和正则化(总体占40.0%),进一步证实了训练稳定性和泛化能力的核心地位。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。