Skip to main content
QUICK REVIEW

[论文解读] Federated Learning of User Authentication Models

Hossein Hosseini, Sungrack Yun|arXiv (Cornell University)|Jul 9, 2020
Internet Traffic Analysis and Secure E-voting参考文献 26被引用 5
一句话总结

本文提出 FedUA,一种隐私保护的联邦学习框架,可在不共享原始数据或嵌入向量的情况下训练用户身份认证模型。通过使用随机二值嵌入向量和一个预热阶段以设定用户特定的阈值,FedUA 即使在嵌入向量长度较短(例如 512 比特)的情况下,也能在未见过的用户上实现高达 80% 的真正例率(TPR)和极低的假正例率(FPR 为 0.16%),同时在联邦设置中实现可扩展的、无需协调的训练。

ABSTRACT

Machine learning-based User Authentication (UA) models have been widely deployed in smart devices. UA models are trained to map input data of different users to highly separable embedding vectors, which are then used to accept or reject new inputs at test time. Training UA models requires having direct access to the raw inputs and embedding vectors of users, both of which are privacy-sensitive information. In this paper, we propose Federated User Authentication (FedUA), a framework for privacy-preserving training of UA models. FedUA adopts federated learning framework to enable a group of users to jointly train a model without sharing the raw inputs. It also allows users to generate their embeddings as random binary vectors, so that, unlike the existing approach of constructing the spread out embeddings by the server, the embedding vectors are kept private as well. We show our method is privacy-preserving, scalable with number of users, and allows new users to be added to training without changing the output layer. Our experimental results on the VoxCeleb dataset for speaker verification shows our method reliably rejects data of unseen users at very high true positive rates.

研究动机与目标

  • 解决集中式训练用户身份认证(UA)模型时存在的隐私风险,其中原始输入和嵌入向量属于敏感信息。
  • 在不共享用户数据或嵌入向量的前提下,实现 UA 模型的联邦训练,确保端到端隐私保护。
  • 允许新用户在不重新训练或修改输出层的情况下加入训练过程。
  • 在隐私保护设计下,仍能保持对未见过用户的高身份认证性能(高 TPR,低 FPR)。
  • 在标准联邦学习通信之外,消除协调开销。

提出的方法

  • 用户使用其原始数据在本地训练模型,服务器确定嵌入向量长度,以确保在高概率下实现最小成对距离。
  • 每位用户生成一个固定长度的、预先确定的随机二值嵌入向量,该向量保持私密,不与服务器或其他用户共享。
  • 模型被训练以最大化其输出与用户私有随机二值嵌入向量之间的相关性。
  • 通过一个预热阶段收集每位用户的测试输入,以计算用户特定的接受阈值,确保达到目标真正例率(TPR)。
  • 使用联邦平均(FedAvg)算法,结合本地训练(E=1 个周期)、SGD 优化器以及最小通信开销。
  • 对嵌入长度(ne)进行调优,以在性能与模型效率之间取得平衡,测试了 ne=128、256 和 512 的情况。

实验结果

研究问题

  • RQ1用户身份认证模型能否在联邦设置中训练,而无需暴露原始输入或嵌入向量?
  • RQ2随机二值嵌入能否在保护隐私的同时,确保用户之间的充分可分性?
  • RQ3系统能否支持新用户在不重新训练或更改输出层的情况下加入训练?
  • RQ4所提出的方法能否在未见过的用户上实现高身份认证性能(如高 TPR、低 FPR)?
  • RQ5该框架能否在仅需标准联邦学习通信开销的基础上实现最小化协调的部署?

主要发现

  • 在 80% 的真正例率(TPR)下,使用 128 比特嵌入向量时,模型在未见过的用户上的假正例率(FPR)为 0.27%。
  • 对于 256 比特嵌入向量,未见过用户的 FPR 降低至 0.18%,同时保持 80% 的 TPR。
  • 使用 512 比特嵌入向量时,未见过用户的 FPR 进一部降低至 0.16%,在 80% TPR 下表现更优,表明更长的嵌入向量可提升性能。
  • 模型在已训练用户的验证数据上保持了强劲性能,尽管在未见过用户上的性能略有下降,但仍能高度可靠地拒绝冒充者。
  • 该框架支持动态添加用户,无需修改输出层或重新训练模型。
  • 使用随机二值嵌入显著减少了输出大小,相比独热编码,实现了可扩展的部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。