[论文解读] Management of Machine Learning Lifecycle Artifacts: A Survey
本文对64个机器学习(ML)生命周期工件管理系统(ML AMSs)进行了全面综述,提出了一套系统化的框架,用于评估和比较其功能与非功能性能力。基于系统性文献综述,作者定义了数据集、模型、超参数和元数据等工件的评估标准,并对MLflow、Weights & Biases和Vertex AI等平台进行了评估,揭示了在ML生命周期中可复现性、可追溯性和工具互操作性方面存在的关键差距。
The explorative and iterative nature of developing and operating machine learning (ML) applications leads to a variety of artifacts, such as datasets, features, models, hyperparameters, metrics, software, configurations, and logs. In order to enable comparability, reproducibility, and traceability of these artifacts across the ML lifecycle steps and iterations, systems and tools have been developed to support their collection, storage, and management. It is often not obvious what precise functional scope such systems offer so that the comparison and the estimation of synergy effects between candidates are quite challenging. In this paper, we aim to give an overview of systems and platforms which support the management of ML lifecycle artifacts. Based on a systematic literature review, we derive assessment criteria and apply them to a representative selection of more than 60 systems and platforms.
研究动机与目标
- 为解决由于功能和非功能性范围不明确而导致的ML工件管理系统(ML AMSs)比较与选择困难的问题。
- 识别并定义用于在功能和非功能性维度上评估ML AMSs的标准化评估标准。
- 基于学术界和工业界的64个ML AMSs,提供全面且基于证据的比较,以支持工具选择与集成。
- 突出当前系统在可复现性、可追溯性和端到端生命周期支持方面的差距。
- 支持研究人员和实践者在MLOps工作流中有效选择和组合ML AMSs。
提出的方法
- 通过系统性文献综述,从学术和工业来源中识别并收集了64个ML AMSs。
- 定义了ML生命周期工件的分类体系,包括数据集、模型、超参数、指标、代码、配置和日志。
- 开发了一套全面的评估标准,涵盖功能特性(如工件追踪、实验管理)和非功能特性(如可扩展性、集成支持)。
- 通过详细分析文档、源代码和平台功能,将评估标准应用于每个识别出的系统。
- 根据系统的主要关注点(如实验追踪、模型注册、MLOps编排)对系统进行分类,并评估其对端到端生命周期管理的支持程度。
- 使用滚雪球法和引用链技术,确保对相关系统和出版物的全面覆盖。
实验结果
研究问题
- RQ1在功能和非功能性能力方面,可用于描述、评估和比较ML工件管理系统(ML AMSs)的标准是什么?
- RQ2学术界和工业界存在哪些ML AMSs,它们在管理ML生命周期工件方面的支持有何差异?
- RQ3现有ML AMSs在实现ML生命周期各阶段的可复现性、可追溯性和可比性方面的优势、局限性以及协同潜力是什么?
- RQ4ML AMSs如何支持对模型、数据集、超参数、元数据和执行日志等多样化工件的管理?
- RQ5当前系统在互操作性、工具链集成和端到端生命周期支持方面存在哪些关键差距?
主要发现
- 该研究识别出64个不同的ML AMSs,其中大多数专注于实验追踪和模型注册,而支持完整生命周期管理的系统较少。
- 仅12%的被调查系统原生支持数据和模型工件的血缘追踪,限制了可复现性。
- MLflow、Weights & Biases和Vertex AI是功能最全面的平台之一,提供对实验追踪、模型注册和超参数调优的集成支持。
- 许多系统缺乏标准化接口或API以实现互操作性,降低了在工具链组合中的协同潜力。
- 在管理软件配置和环境依赖方面存在显著差距,而这些因素对可复现性至关重要。
- 该综述发现,尽管大多数系统支持模型和实验追踪,但仅少数支持特征、数据预处理流水线或模型推理日志的版本控制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。