Skip to main content
QUICK REVIEW

[论文解读] Federated Action Recognition on Heterogeneous Embedded Devices

Pranjal Jain, Shreyas Goenka|arXiv (Cornell University)|Jul 18, 2021
Privacy-Preserving Technologies in Data参考文献 60被引用 5
一句话总结

本文提出了一种用于异构嵌入式设备上动作识别的异步联邦学习框架,通过使用大规模Kinetics模型进行知识蒸馏,实现对小型本地数据集的高精度微调。在HMDB51上达到55.6%的每片段top-1准确率,在UCF101上达到89.5%,与中心化服务器微调相比误差在2%以内,同时相比同步方法将训练时间减少了40%。

ABSTRACT

Federated learning allows a large number of devices to jointly learn a model without sharing data. In this work, we enable clients with limited computing power to perform action recognition, a computationally heavy task. We first perform model compression at the central server through knowledge distillation on a large dataset. This allows the model to learn complex features and serves as an initialization for model fine-tuning. The fine-tuning is required because the limited data present in smaller datasets is not adequate for action recognition models to learn complex spatio-temporal features. Because the clients present are often heterogeneous in their computing resources, we use an asynchronous federated optimization and we further show a convergence bound. We compare our approach to two baseline approaches: fine-tuning at the central server (no clients) and fine-tuning using (heterogeneous) clients using synchronous federated averaging. We empirically show on a testbed of heterogeneous embedded devices that we can perform action recognition with comparable accuracy to the two baselines above, while our asynchronous learning strategy reduces the training time by 40%, relative to synchronous learning.

研究动机与目标

  • 在本地数据集过小、难以有效训练的资源受限嵌入式设备上实现动作识别。
  • 通过知识蒸馏利用预训练模型,解决HMDB51和UCF101等小数据集上的模型过拟合问题。
  • 克服同步联邦学习在异构边缘环境中因慢速设备(拖尾设备)导致训练延迟的局限性。
  • 提出并理论推导适用于实际边缘部署中设备能力差异的异步联邦优化策略的收敛边界。
  • 证明边缘联邦学习可在不共享原始视频数据的前提下,实现与集中式训练相当的准确率。

提出的方法

  • 在中心服务器使用ResNet-34作为教师模型,对Kinetics-400数据集上的小型ResNet-18学生模型进行知识蒸馏。
  • 将蒸馏得到的ResNet-18作为初始化权重,用于在本地客户端数据集(HMDB51和UCF101)上进行微调,提升小样本数据下的泛化能力。
  • 实现一种异步联邦平均算法,客户端独立更新全局模型,无需等待所有设备完成。
  • 引入混合超参数β和自适应聚合权重a,以控制客户端更新对全局模型的影响,提升收敛稳定性。
  • 理论分析为在非独立同分布(non-iid)和异构客户端条件下,异步联邦优化提供了收敛边界。
  • 通过实验调参确定最优超参数设置(a=0.5,β=0.7),以在HMDB51和UCF101数据集上最大化准确率。

实验结果

研究问题

  • RQ1能否通过大规模预训练模型的知识蒸馏,提升边缘设备在小型本地数据集上的动作识别准确率?
  • RQ2在异构嵌入式设备上,异步联邦学习与同步联邦平均相比,在收敛速度和准确率方面表现如何?
  • RQ3在异步联邦训练中,哪些超参数设置(a和β)能在收敛速度与模型准确率之间实现最佳权衡?
  • RQ4边缘设备上的联邦学习在不共享数据的前提下,能在多大程度上实现与集中式训练相当的准确率?
  • RQ5所提出的框架能否有效应对实际嵌入式设备(如Jetson Nano和AGX Xavier)在计算与存储方面的限制?

主要发现

  • 所提出的异步联邦学习框架在异构嵌入式设备测试平台上,相比同步联邦平均,将训练时间减少了40%。
  • 在超参数a=0.5和β=0.7的设置下,该方法在HMDB51上达到55.6%的每片段top-1准确率,在UCF101上达到89.5%,与中心服务器微调基线(HMDB51为57.3%)的差距在2%以内。
  • 通过教学助教(TA)蒸馏得到的ResNet-18模型在Kinetics-400上达到54.6%的每片段准确率,优于直接从ResNet-34蒸馏(53.8%)和从零开始训练(50.2%)。
  • 各设备每轮训练时间差异显著:Jetson Nano的训练时间是AGX Xavier的4.7倍,凸显了异步训练避免拖尾瓶颈的必要性。
  • 异步训练中,β值越小,收敛速度越慢,因为其对客户端更新赋予的权重越低,该现象在实验结果中得到实证验证。
  • 在知识蒸馏过程中增加超过一个教学助教,带来的准确率增益可忽略不计,但显著增加了训练时间,表明收益递减。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。