[论文解读] MLOps Challenges in Multi-Organization Setup: Experiences from Two Real-World Cases
该论文呈现两个真实世界的多组织 MLOps 案例(Oravizio 和 AuroraAI),分析集成、数据所有权、建模、监控和治理方面的挑战,并提出应对它们的模式和组织实践。
The emerging age of connected, digital world means that there are tons of data, distributed to various organizations and their databases. Since this data can be confidential in nature, it cannot always be openly shared in seek of artificial intelligence (AI) and machine learning (ML) solutions. Instead, we need integration mechanisms, analogous to integration patterns in information systems, to create multi-organization AI/ML systems. In this paper, we present two real-world cases. First, we study integration between two organizations in detail. Second, we address scaling of AI/ML to multi-organization context. The setup we assume is that of continuous deployment, often referred to DevOps in software development. When also ML components are deployed in a similar fashion, term MLOps is used. Towards the end of the paper, we list the main observations and draw some final conclusions. Finally, we propose some directions for future work.
研究动机与目标
- 在数据不能自由共享的多组织环境中,推动对 MLOps 的研究。
- 识别并分析跨越组织边界的整合与扩展挑战。
- 提供可行的模式和治理概念,以实现多组织 ML 部署。
- 突出数据所有权与监管约束如何塑造 MLOps 实践。
提出的方法
- 呈现两个真实世界的案例研究:Oravizio(两家组织共享一个医疗 ML 服务)和 AuroraAI(面向公共服务的多组织 AI 规模化)。
- 在每个案例中分析数据集所有权、模型共享、监控和治理。
- 讨论用于实现跨组织 ML 制品的模式与架构决策(例如,将模型视为共享的软件组件)。
- 将研究结果与 CD4ML 以及 DevOps/MLOps 的概念联系起来,以框架化 ML 场景中的持续部署。
实验结果
研究问题
- RQ1在保持数据隐私和所有权约束的前提下,如何在跨越组织边界的情况下集成 ML 功能?
- RQ2哪些切实可行的模式和组织实践可以实现可靠的多组织 MLOps?
- RQ3数据治理、监管约束和模型交接在跨组织的 ML 部署中如何影响?
- RQ4在将 ML 解决方案扩展到如 AuroraAI 这类多组织生态系统时,哪些因素是必需考虑的?
主要发现
- 数据所有权和监管约束使跨组织数据移动变得困难,驱动/推动数据湖和共享模式以在保持边界的同时进行。
- 在数据无法暴露的情况下,共享的 ML 模型可作为跨组织协作的主要制品,模型开发和部署分布在各组织之间。
- 多组织 MLOps 的监控必须考虑偏差、漂移和治理,通常需要人机在环决策和明确的责任边界。
- 诸如 Evaluator(Oravizio)和 User Delegation(AuroraAI)等模式展示了跨组织 ML 协作的实际方法。
- 成功的多组织 ML 需要联合操作模式(OrgOps)及超越单一组织的 DevOps 合作,识别文化和治理差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。