Skip to main content
QUICK REVIEW

[论文解读] On-device Training: A First Overview on Existing Systems

Shuai Zhu, Thiemo Voigt|arXiv (Cornell University)|Dec 1, 2022
Age of Information Optimization被引用 4
一句话总结

本文对设备端机器学习训练的系统级综述进行了全面分析,研究了现有框架如何在资源受限设备(如智能手机和微控制器)上直接实现模型训练。文章识别出关键优化技术,如模型剪枝、量化、持续增长和强化学习,这些技术可实现高效设备端训练,同时保护隐私、降低延迟并消除对云连接的依赖。

ABSTRACT

The recent breakthroughs in machine learning (ML) and deep learning (DL) have catalyzed the design and development of various intelligent systems over wide application domains. While most existing machine learning models require large memory and computing power, efforts have been made to deploy some models on resource-constrained devices as well. A majority of the early application systems focused on exploiting the inference capabilities of ML and DL models, where data captured from different mobile and embedded sensing components are processed through these models for application goals such as classification and segmentation. More recently, the concept of exploiting the mobile and embedded computing resources for ML/DL model training has gained attention, as such capabilities allow (i) the training of models via local data without the need to share data over wireless links, thus enabling privacy-preserving computation by design, (ii) model personalization and environment adaptation, and (ii) deployment of accurate models in remote and hardly accessible locations without stable internet connectivity. This work targets to summarize and analyze state-of-the-art systems research that allows such on-device model training capabilities and provide a survey of on-device training from a systems perspective.

研究动机与目标

  • 提供对现有设备端训练框架的系统性、系统导向的综述,重点聚焦于实现与优化策略。
  • 识别并分析实现设备端训练的关键技术挑战,特别是有限硬件资源与模型训练高计算需求之间的不匹配问题。
  • 突出设备端训练的优势,包括隐私保护、通信开销减少以及对本地数据和环境的适应能力。
  • 探索研究空白,特别是对配备亚GHz处理器和KB级内存的超小型物联网设备缺乏支持的问题。
  • 提出未来研究方向,包括混合优化技术以及面向嵌入式平台的操作系统级集成。

提出的方法

  • 根据目标硬件平台(包括智能手机和基于微控制器的设备)对现有设备端训练系统进行调研与分类。
  • 分析模型剪枝、量化和混合精度训练等优化技术,以减少训练过程中的内存与计算资源消耗。
  • 评估连续增长方法,即从小型神经网络开始并逐步扩展以满足精度要求。
  • 研究基于强化学习的解决方案,用于动态资源管理(如DVFS,动态电压和频率调节),以优化能效与性能。
  • 评估现有操作系统(如Android、FreeRTOS、Contiki)在支持或限制设备端训练系统部署方面的作用。
  • 提出结合多种优化策略(如连续增长 + 内存管理)的混合系统设计,以提升整体效率。

实验结果

研究问题

  • RQ1在资源受限设备上实现设备端训练的主要系统级挑战是什么?
  • RQ2现有框架在内存、计算和能耗方面如何优化移动和嵌入式平台的模型训练?
  • RQ3高端智能手机与超小型微控制器在设备端训练支持方面存在哪些关键差异?
  • RQ4模型剪枝、量化和连续增长等技术在多大程度上可降低设备端训练期间的资源消耗?
  • RQ5为实现对内存和操作系统抽象极简的最苛刻物联网设备上的设备端训练,未来需要哪些研究方向?

主要发现

  • 设备端训练通过将数据和训练过程保留在本地,实现了隐私保护、低延迟和离线可用的机器学习。
  • 智能手机是主要目标平台,因其具备GB级别内存和GPU、NPU等硬件加速器。
  • 基于微控制器的平台仍面临重大挑战,其资源极度受限——通常仅限KB级别内存和亚GHz时钟频率。
  • 模型剪枝和量化等技术显著降低了内存与计算需求,使在更小设备上训练成为可能。
  • 连续增长和基于强化学习的优化策略在训练过程中动态调整模型大小与资源使用方面展现出良好前景。
  • 针对高度受限设备的系统仍较少,亟需一个统一且可扩展的框架,支持按平台定制化和操作系统级集成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。