Skip to main content
QUICK REVIEW

[论文解读] Privacy-preserving Transfer Learning via Secure Maximum Mean Discrepancy

Bin Zhang, Cen Chen|arXiv (Cornell University)|Sep 24, 2020
Privacy-Preserving Technologies in Data参考文献 22被引用 5
一句话总结

本文提出安全最大均值差异(SMMD),一种隐私保护的迁移学习方法,利用同态加密计算MMD损失而不暴露原始数据,实现安全的域自适应。SMMD在保持与非加密MMD几乎相同性能的同时,防止信息泄露,在多个数据集的联邦设置中展现出高准确率与高安全性。

ABSTRACT

The success of machine learning algorithms often relies on a large amount of high-quality data to train well-performed models. However, data is a valuable resource and are always held by different parties in reality. An effective solution to such a data isolation problem is to employ federated learning, which allows multiple parties to collaboratively train a model. In this paper, we propose a Secure version of the widely used Maximum Mean Discrepancy (SMMD) based on homomorphic encryption to enable effective knowledge transfer under the data federation setting without compromising the data privacy. The proposed SMMD is able to avoid the potential information leakage in transfer learning when aligning the source and target data distribution. As a result, both the source domain and target domain can fully utilize their data to build more scalable models. Experimental results demonstrate that our proposed SMMD is secure and effective.

研究动机与目标

  • 解决在对齐源域与目标域分布时迁移学习中的隐私泄露问题。
  • 在联邦学习中实现有效知识迁移,而无需在机构间共享原始数据。
  • 开发一种安全、高效且准确的域对齐方法,以保护数据机密性。
  • 评估不同核函数对隐私保护迁移学习性能的影响。

提出的方法

  • 提出SMMD,一种基于同态加密的安全版最大均值差异(MMD),可在不暴露原始数据的情况下计算分布距离。
  • 采用同态加密,允许在加密的源域与目标域特征表示上安全计算MMD损失。
  • 在加密框架内应用多种核函数——线性、多项式与高斯核,以评估可迁移性与鲁棒性。
  • 设计一个包含卷积层和Sigmoid输出的深度学习模型,用于分类,使用L1=128和L2=64个神经元。
  • 采用二阶泰勒展开实现高斯核的高效加密计算。
  • 使用标准指标评估性能:F1-score、AUC与精确率,数据集为UCI-Credit-Card与UCI-Census-Income。

实验结果

研究问题

  • RQ1在联邦学习设置中,是否可以不暴露原始数据而安全地计算基于MMD的域对齐?
  • RQ2同态加密对迁移学习中MMD计算的准确率与效率有何影响?
  • RQ3在安全计算下,哪种核函数(线性、多项式、高斯)性能最佳?
  • RQ4SMMD在模型性能上与非加密MMD及仅使用源域的基线方法相比如何?

主要发现

  • SMMD在性能上几乎与非加密MMD持平,加密线性核在UCI-Credit-Card数据集上取得0.684的F1-score,而未加密时为0.693。
  • 高斯核表现最佳,在UCI-Credit-Card数据集上,非加密与加密设置下均达到0.702的AUC。
  • 性能在各类核函数间保持稳定,加密下准确率下降极小——例如,高斯核(σ=1)在加密下AUC为0.724,未加密时为0.739。
  • SMMD显著优于FTL基线,在UCI-Census-Income数据集上分别实现0.851的精确率(对比0.845)与0.787的AUC(对比0.712)。
  • 仅使用源域的基线表现持续较差,UCI-Credit-Card数据集上F1-score为0.665,证实了迁移学习的价值。
  • 该方法在不同核函数下均具鲁棒性,多项式核随阶数增加出现轻微性能下降,归因于计算复杂度增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。