Skip to main content
QUICK REVIEW

[论文解读] Warmup and Transfer Knowledge-Based Federated Learning Approach for IoT Continuous Authentication

Mohamad Wazzeh, Hakima Ould‐Slimane|arXiv (Cornell University)|Nov 10, 2022
User Authentication and Security Systems被引用 7
一句话总结

本文提出了一种用于物联网连续认证的隐私保护联邦学习框架,通过引入预热阶段和迁移学习,提升了在非独立同分布(non-IID)行为数据上的模型准确率。通过使用少量数据子集初始化模型,并利用预训练的特征提取器,该方法在FEMNIST和UMDAA-02-FD数据集上相比FedAvg准确率最高提升了70%,同时保护了用户数据隐私。

ABSTRACT

Continuous behavioural authentication methods add a unique layer of security by allowing individuals to verify their unique identity when accessing a device. Maintaining session authenticity is now feasible by monitoring users' behaviour while interacting with a mobile or Internet of Things (IoT) device, making credential theft and session hijacking ineffective. Such a technique is made possible by integrating the power of artificial intelligence and Machine Learning (ML). Most of the literature focuses on training machine learning for the user by transmitting their data to an external server, subject to private user data exposure to threats. In this paper, we propose a novel Federated Learning (FL) approach that protects the anonymity of user data and maintains the security of his data. We present a warmup approach that provides a significant accuracy increase. In addition, we leverage the transfer learning technique based on feature extraction to boost the models' performance. Our extensive experiments based on four datasets: MNIST, FEMNIST, CIFAR-10 and UMDAA-02-FD, show a significant increase in user authentication accuracy while maintaining user privacy and data security.

研究动机与目标

  • 解决在连续认证系统中传输原始行为数据带来的隐私风险。
  • 提升联邦学习在物联网和移动设备上非独立同分布、用户特定行为数据上的性能。
  • 减少因客户端间独特且标签特定的数据分布导致的模型偏差和准确率下降。
  • 在不共享原始用户数据的前提下提升模型准确率,确保符合GDPR等隐私法规。
  • 展示预热和迁移学习在提升联邦模型收敛性和性能方面的有效性。

提出的方法

  • 通过仅使用每个客户端5%的数据进行预热阶段,初始化全局模型,为全量联邦训练提供性能提升。
  • 通过使用预训练的卷积神经网络(CNN)特征提取器应用迁移学习,以改善行为数据的表征学习。
  • 在服务器端使用FedAvg算法聚合客户端模型权重,以保护数据隐私。
  • 每个客户端在其独有的非独立同分布行为数据上训练本地模型,仅共享模型权重,不共享原始数据。
  • 在四个数据集(MNIST、FEMNIST、CIFAR-10和UMDAA-02-FD)上评估该框架,使用CNN提取基于图像的行为特征。
  • 采用自定义的数据划分策略,为每个客户端分配唯一标签,以模拟现实世界中非独立同分布的用户行为。

实验结果

研究问题

  • RQ1预热阶段是否能显著提升在非独立同分布行为数据上进行连续认证的联邦学习准确率?
  • RQ2使用预训练特征提取器的迁移学习在物联网认证的联邦学习中如何提升模型性能?
  • RQ3所提方法在非独立同分布、标签特定的行为数据上相比标准FedAvg的性能提升程度如何?
  • RQ4是否能在不传输原始用户数据的前提下实现高模型准确率,确保隐私合规?
  • RQ5预热与迁移学习的结合是否能减少联邦学习中模型偏差并改善收敛性?

主要发现

  • 在FEMNIST数据集上,仅使用客户端5%数据的预热阶段使准确率相比标准FedAvg提升了60%,而后者始终低于2%。
  • 在UMDAA-02-FD数据集上,所提方法相比FedAvg实现了70%的准确率提升。
  • 使用预训练特征提取器的迁移学习方法显著提升了性能,尤其在复杂行为数据(如人脸图像)上表现突出。
  • 该框架在所有测试数据集上均保持了高准确率——CIFAR-10(提升40%)、FEMNIST(提升60%)、UMDAA-02-FD(提升70%),且未共享原始数据。
  • 该方法有效缓解了由非独立同分布数据引起的模型偏差,改善了全局模型的收敛性。
  • 通过在本地训练模型并仅共享模型权重,该方法实现了强大的隐私保护,符合GDPR等法规要求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。