Skip to main content
QUICK REVIEW

[论文解读] From Server-Based to Client-Based Machine Learning: A Comprehensive Survey

Renjie Gu, Chaoyue Niu|arXiv (Cornell University)|Sep 18, 2019
Privacy-Preserving Technologies in Data参考文献 36被引用 5
一句话总结

本综述全面分析了从基于服务器的机器学习向基于客户端的机器学习的转变,强调联邦学习和分割学习作为关键范式,可在保护用户隐私的同时实现在设备上的模型训练。文章回顾了基于客户端学习的演进历程、架构、挑战及未来方向,提出了统一的框架与实际部署指南。

ABSTRACT

In recent years, mobile devices have gained increasing development with stronger computation capability and larger storage space. Some of the computation-intensive machine learning tasks can now be run on mobile devices. To exploit the resources available on mobile devices and preserve personal privacy, the concept of client-based machine learning has been proposed. It leverages the users' local hardware and local data to solve machine learning sub-problems on mobile devices and only uploads computation results rather than the original data for the optimization of the global model. Such an architecture can not only relieve computation and storage burdens on servers but also protect the users' sensitive information. Another benefit is the bandwidth reduction because various kinds of local data can be involved in the training process without being uploaded. In this article, we provide a literature review on the progressive development of machine learning from server based to client based. We revisit a number of widely used server-based and client-based machine learning methods and applications. We also extensively discuss the challenges and future directions in this area. We believe that this survey will give a clear overview of client-based machine learning and provide guidelines on applying client-based machine learning to practice.

研究动机与目标

  • 系统性回顾从集中式、基于服务器的机器学习向去中心化、基于客户端的学习范式的发展历程。
  • 识别并分析基于客户端学习的核心动因,包括隐私保护、减少带宽使用以及高效利用移动设备资源。
  • 研究基于客户端训练中的技术挑战,如非独立同分布(non-IID)数据分布、通信效率和模型收敛性问题。
  • 为在真实世界应用中实现基于客户端的机器学习,特别是在移动和边缘计算环境中,提供实用指导。
  • 指出开放的研究问题与未来方向,包括基准测试、标准化以及在多样化应用领域中的广泛部署。

提出的方法

  • 调研并分类现有的基于服务器和基于客户端的机器学习方法,包括联邦学习、分割学习及相关分布式优化技术。
  • 分析集中式训练与基于客户端训练之间的架构差异,重点关注数据本地性、通信模式和信任模型。
  • 提出基于客户端训练的形式化任务定义,强调“不上传”约束以及利用本地数据进行模型优化。
  • 通过对比分析现有移动机器学习工具及其对设备端训练的支持情况,评估基于客户端训练框架的性能。
  • 回顾关键框架,如TensorFlow Lite、Core ML、PyTorch Mobile、NCNN、Paddle Lite和MNN,重点关注其在推理能力以及(在可用情况下)设备端训练方面的功能。
  • 提出需要建立标准化的基准测试集和数据集(如LEAF),以支持非独立同分布、用户划分的数据,从而公平评估基于客户端学习的算法。

实验结果

研究问题

  • RQ1基于服务器和基于客户端的机器学习在关键技术与架构上存在哪些关键差异?这些差异如何影响性能、隐私和可扩展性?
  • RQ2联邦学习与分割学习如何在不将原始数据传输至中心服务器的情况下实现隐私保护的机器学习?
  • RQ3基于客户端训练中的主要挑战有哪些,包括数据异质性(non-IID)、通信开销和模型收敛性?
  • RQ4现有移动机器学习框架在支持设备端训练方面存在哪些当前局限性?如何加以改进?
  • RQ5为推进基于客户端机器学习的实际部署,未来需要哪些研究方向和标准化工作?

主要发现

  • 基于客户端的机器学习,特别是联邦学习与分割学习,能够直接在移动设备上训练模型,显著减少将原始用户数据上传至中心服务器的需求。
  • 采用基于客户端的训练可降低服务器端的计算与存储负担,减少通信成本,并通过将敏感数据保留在本地来增强用户隐私。
  • 尽管已有进展,但现有移动框架(如TensorFlow Lite和PyTorch Mobile)主要支持推理功能,对设备端训练的原生支持有限,暴露出完整移动端机器学习工具链的缺口。
  • 阿里巴巴的MNN框架被特别指出为少数支持端到端设备内模型构建与训练的实例,表明向完整移动端训练能力发展的趋势正在增强。
  • LEAF等基准数据集可用于非独立同分布、用户划分的数据,但其覆盖范围仍局限于少数任务,表明亟需更广泛、标准化的数据集以评估基于客户端的算法。
  • 缺乏标准化的评估指标与部署指南,仍是跨不同应用与领域比较和部署基于客户端训练解决方案的主要障碍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。