Skip to main content
QUICK REVIEW

[论文解读] Beyond the technical challenges for deploying Machine Learning solutions in a software company

Ilias Flaounas|arXiv (Cornell University)|Aug 8, 2017
Ethics and Social Impacts of AI参考文献 2被引用 13
一句话总结

本文探讨了在软件公司中部署机器学习系统时面临的非技术性、以人为本的挑战,强调在构思、执行和运维各阶段跨利益相关方协作的重要性。文章认为,成功的机器学习部署依赖于产品经理、工程师、数据科学家和SRE通过共同责任、清晰沟通和运维韧性实现对齐——突出表明90%的工作量往往集中在模型训练之外的生产化和维护阶段。

ABSTRACT

Recently software development companies started to embrace Machine Learning (ML) techniques for introducing a series of advanced functionality in their products such as personalisation of the user experience, improved search, content recommendation and automation. The technical challenges for tackling these problems are heavily researched in literature. A less studied area is a pragmatic approach to the role of humans in a complex modern industrial environment where ML based systems are developed. Key stakeholders affect the system from inception and up to operation and maintenance. Product managers want to embed "smart" experiences for their users and drive the decisions on what should be built next; software engineers are challenged to build or utilise ML software tools that require skills that are well outside of their comfort zone; legal and risk departments may influence design choices and data access; operations teams are requested to maintain ML systems which are non-stationary in their nature and change behaviour over time; and finally ML practitioners should communicate with all these stakeholders to successfully build a reliable system. This paper discusses some of the challenges we faced in Atlassian as we started investing more in the ML space.

研究动机与目标

  • 识别并分析工业软件环境中超越算法挑战的机器学习部署非技术性障碍。
  • 研究产品经理、数据科学家、SRE、法务团队和开发人员等多样化利益相关方在整个机器学习生命周期中的角色与挑战。
  • 强调在现实环境中长期运维机器学习系统的操作复杂性,特别是由于数据漂移、不稳定性和非平稳行为所致。
  • 倡导采用组织实践如“你构建的,你维护”和功能标志(feature flags)以提升系统可靠性和所有权意识。
  • 提供一个务实的机器学习项目管理框架,平衡性能、可扩展性与长期可维护性。

提出的方法

  • 在Atlassian公司开展案例研究,记录在构思、执行和运维各阶段中实际面临的机器学习部署挑战。
  • 使用结构化表格将关键利益相关方与各阶段的具体挑战进行映射(例如,产品经理面临影响评估挑战;SRE面临系统稳定性挑战)。
  • 强调使用功能标志以实现在模型性能下降时的运行时故障转移,减少系统停机时间。
  • 倡导采用人机协同机制,如对误报/漏报的反馈回路,以调整和稳定模型。
  • 基于既定最佳实践(如Breck等,2016)提出运维监控实践,以追踪模型性能和数据质量。
  • 强调跨职能协作与共同责任的重要性,尤其通过“你构建的,你维护”原则。

实验结果

研究问题

  • RQ1在软件公司中,利益相关方在部署机器学习系统时面临哪些非技术性挑战?
  • RQ2为何机器学习系统的生产化阶段常消耗90%的工作量,尽管它被视为开发的最后10%?
  • RQ3数据源的不稳定性与非平稳性如何影响现实环境中机器学习系统的长期运行?
  • RQ4哪些组织与工程实践可提升机器学习系统在生产环境中的可维护性与可靠性?
  • RQ5反馈机制与功能标志如何缓解数据输入高度可变的机器学习系统中的操作风险?

主要发现

  • 机器学习原型的生产化通常占据总项目时间的90%,尽管它被视为开发的最后10%。
  • 产品经理、法务团队和SRE等利益相关方虽非主要负责模型训练,却显著影响系统设计与部署。
  • 数据源的不稳定性与非平稳性是导致模型性能下降的主要原因,通常需要主动监控与人工反馈才能恢复。
  • “你构建的,你维护”原则对确保系统长期可靠性至关重要,可防止技术债务累积。
  • 功能标志可在模型性能下降时实现安全的故障转移至备用系统,减少停机时间并提升运维韧性。
  • 调优与反馈机制——尤其是对误报与漏报的处理——往往是机器学习系统维护中最耗时的部分,而非模型训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。