Skip to main content
QUICK REVIEW

[论文解读] Collaboration Challenges in Building ML-Enabled Systems: Communication, Documentation, Engineering, and Process

Nadia Nahar, Shurui Zhou|arXiv (Cornell University)|Oct 19, 2021
Big Data and Business Intelligence被引用 20
一句话总结

本文通过访谈来自28家组织的45名从业者,识别出在构建机器学习增强系统过程中面临的核心协作挑战。研究突出强调了三个关键协作节点——需求识别、数据质量协商以及产品与模型的集成——并强调沟通、文档、工程实践和流程作为核心主题,同时为提升机器学习开发中的跨学科团队协作提供了可操作的建议。

ABSTRACT

The introduction of machine learning (ML) components in software projects has created the need for software engineers to collaborate with data scientists and other specialists. While collaboration can always be challenging, ML introduces additional challenges with its exploratory model development process, additional skills and knowledge needed, difficulties testing ML systems, need for continuous evolution and monitoring, and non-traditional quality requirements such as fairness and explainability. Through interviews with 45 practitioners from 28 organizations, we identified key collaboration challenges that teams face when building and deploying ML systems into production. We report on common collaboration points in the development of production ML systems for requirements, data, and integration, as well as corresponding team patterns and challenges. We find that most of these challenges center around communication, documentation, engineering, and process and collect recommendations to address these challenges.

研究动机与目标

  • 理解在构建用于生产的机器学习增强系统时,数据科学家与软件工程师之间的协作挑战。
  • 识别在不同组织结构中,需求、数据和集成方面反复出现的协作节点及其相关挑战。
  • 研究组织模式、团队构成和权力动态如何影响机器学习项目中协作的有效性。
  • 突出强调工程实践、文档和流程在机器学习系统开发中的被低估作用,超越以模型为中心的关注点。
  • 基于证据提出建议,通过改善沟通、文档和规划,提升机器学习开发中的跨学科协作。

提出的方法

  • 对来自28家组织的45名从业者(包括数据科学家、软件工程师和管理人员)进行了半结构化访谈。
  • 采用主题分析法分析访谈数据,识别在不同组织背景下反复出现的协作节点与挑战。
  • 通过机器学习系统、软件工程和协作挑战相关文献综述,对研究发现进行三角验证。
  • 利用访谈中的案例示例,绘制组织结构和团队模式图,包括团队角色与职责的可视化表示。
  • 识别出在关键协作节点(如需求分解、数据协商、机器学习与软件工程工作的集成)存在的普遍挑战。
  • 基于观察到的模式提出建议,强调跨学科团队中文档、工程严谨性与流程规划的重要性。

实验结果

研究问题

  • RQ1在机器学习增强系统开发中,数据科学家与软件工程师之间最主要的协作节点是什么?
  • RQ2在这些协作节点上,特别是在需求、数据和集成方面,具体面临哪些挑战?
  • RQ3组织结构、团队构成和权力动态如何影响机器学习项目中的协作成果?
  • RQ4哪些团队组织与实践模式与更好的或更差的协作成果相关联?
  • RQ5可以提出哪些建议,通过改善沟通、文档、工程实践与流程来提升协作效果?

主要发现

  • 最关键的三个协作节点是需求识别、数据质量与数量的协商,以及产品与模型的集成,每个节点都带来了独特的跨学科挑战。
  • 沟通障碍普遍存在,尤其由于技术背景和术语差异,许多从业者报告数据科学家与软件工程师之间存在目标不一致的情况。
  • 文档常常不足或不一致,缺乏标准化实践来规范模型需求、数据期望,以及公平性、可解释性等模型质量属性。
  • 工程实践常被低估;尽管机器学习引入了更高复杂度,团队仍因缺乏自动化、测试和监控而难以实现模型的生产化。
  • 流程挑战源于机器学习的非线性、探索性本质与传统软件开发生命周期之间的冲突,导致时间线错配和职责不明确。
  • 协作成果更好的组织通常会投资于跨学科培训、清晰的接口文档,以及在规划阶段即让数据科学与软件工程团队共同参与。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。