Skip to main content
QUICK REVIEW

[论文解读] Orchestrating the Development Lifecycle of Machine Learning-Based IoT Applications: A Taxonomy and Survey

Bin Qian, Jie Su|White Rose Research Online (University of Leeds, The University of Sheffield, University of York)|Oct 11, 2019
Data Stream Mining Techniques参考文献 402被引用 13
一句话总结

本文提出了一个针对基于机器学习的物联网应用端到端开发生命周期的全面分类法与综述,识别了在规范、训练、部署和监控等环节中编排的若干关键挑战。它提出了一套结构化的路线图,并对数据获取、模型开发和融合策略中的技术进行了分类,指出了现有编排框架在异构物联网环境中的不足。

ABSTRACT

Machine Learning (ML) and Internet of Things (IoT) are complementary advances: ML techniques unlock complete potentials of IoT with intelligence, and IoT applications increasingly feed data collected by sensors into ML models, thereby employing results to improve their business processes and services. Hence, orchestrating ML pipelines that encompasses model training and implication involved in holistic development lifecycle of an IoT application often leads to complex system integration. This paper provides a comprehensive and systematic survey on the development lifecycle of ML-based IoT application. We outline core roadmap and taxonomy, and subsequently assess and compare existing standard techniques used in individual stage.

研究动机与目标

  • 解决在异构环境中缺乏对基于机器学习的物联网应用进行整体编排框架的问题。
  • 识别并系统化基于机器学习的物联网开发生命周期的核心阶段:规范、数据获取、模型训练、部署和监控。
  • 提出一种新颖的分类法,对各阶段使用的技术进行分类,以促进方法间的比较与选择。
  • 突出数据融合、模型优化和生命周期监控方面的开放研究挑战,以支持可靠、可扩展的物联网-机器学习系统。
  • 通过整合现有解决方案并识别编排方面的差距,为未来研究提供指导,尤其关注实时、资源受限的物联网部署。

提出的方法

  • 提出一个五阶段开发生命周期路线图:需求规范、基础设施与数据管道设计、模型开发与训练、在边缘/云/物联网设备上的部署,以及运行时监控与审计。
  • 引入一个包含三个主要组成部分的分类法:(1) 数据获取(数据源、协议、质量),(2) 模型开发(算法、优化),(3) 数据融合(概率型、基于知识、基于证据的方法)。
  • 将数据融合技术分为三类:概率型(如贝叶斯、马尔可夫)、基于知识型(如监督/无监督学习)和基于证据型(如Dempster-Shafer定理)。
  • 从可扩展性、准确性和计算成本等方面分析各类技术的权衡,尤其关注资源受限的物联网设备。
  • 以实际智慧城市应用(如交通路径规划、汽车导航)作为案例研究,说明生命周期各阶段及系统集成挑战。
  • 对现有编排工具(如Juju、Puppet、Chef)进行批判性回顾,识别其在处理物联网异构性及完整机器学习生命周期支持方面的局限性。

实验结果

研究问题

  • RQ1基于机器学习的物联网应用端到端开发生命周期中的关键阶段与组成部分是什么?
  • RQ2现有编排框架在支持基于机器学习的物联网系统完整生命周期方面存在哪些不足,特别是在异构物联网环境中?
  • RQ3在物联网-机器学习应用中,数据获取、模型训练和数据融合的主导技术及其权衡是什么?
  • RQ4数据重用、重新组织与特征演化如何提升流式物联网数据中模型的性能与系统适应性?
  • RQ5在生产环境中,基于机器学习的物联网应用的监控、审计与迭代改进方面存在哪些开放研究挑战?

主要发现

  • 像Juju、Puppet和Chef这样的现有编排框架缺乏对完整基于机器学习的物联网开发生命周期的原生支持,尤其是在处理物联网异构性方面。
  • 概率型数据融合方法(如贝叶斯、马尔可夫)被广泛使用,但在可扩展性及处理噪声或不确定数据方面存在困难,尤其在高维或多模态输入下。
  • 基于知识的数据融合方法通过利用学习到的模式提高准确性,但需要更多计算资源,因此在低功耗物联网设备上适用性较低。
  • 基于证据的方法(如Dempster-Shafer定理)通过引入“未知”状态更好地捕捉不确定性,但其复杂度随证据量增加而显著上升,限制了在边缘环境中的应用。
  • 数据重用与重新组织可显著降低数据采集成本并提升模型泛化能力,尤其在半监督或迁移学习场景中。
  • 特征演化(即考虑流式数据中特征的动态出现与消失)对于长期维持模型准确性至关重要,尤其在真实世界的物联网部署中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。