[论文解读] NN-EMD: Efficiently Training Neural Networks using Encrypted Multi-Sourced Datasets
该论文提出 NN-EMD,一种新颖的框架,通过混合功能加密技术,高效地在加密的多源数据集上训练深度神经网络(DNNs)。该框架在多个不可信数据源之间实现安全、隐私保护的训练,与现有方法相比,训练时间减少 97%,且随着模型深度增加,性能无下降。
Training a machine learning model over an encrypted dataset is an existing promising approach to address the privacy-preserving machine learning task, however, it is extremely challenging to efficiently train a deep neural network (DNN) model over encrypted data for two reasons: first, it requires large-scale computation over huge datasets; second, the existing solutions for computation over encrypted data, such as homomorphic encryption, is inefficient. Further, for an enhanced performance of a DNN model, we also need to use huge training datasets composed of data from multiple data sources that may not have pre-established trust relationships among each other. We propose a novel framework, NN-EMD, to train DNN over multiple encrypted datasets collected from multiple sources. Toward this, we propose a set of secure computation protocols using hybrid functional encryption schemes. We evaluate our framework for performance with regards to the training time and model accuracy on the MNIST datasets. Compared to other existing frameworks, our proposed NN-EMD framework can significantly reduce the training time, while providing comparable model accuracy and privacy guarantees as well as supporting multiple data sources. Furthermore, the depth and complexity of neural networks do not affect the training time despite introducing a privacy-preserving NN-EMD setting.
研究动机与目标
- 解决在不损害数据机密性的情况下,对隐私敏感的多源数据集进行深度神经网络训练的挑战。
- 克服同态加密和通用安全多方计算在大规模 DNN 训练中的低效问题。
- 在无预先信任关系的多个数据源之间实现安全训练。
- 支持来自多个源的水平和垂直数据划分,同时保护隐私。
- 实现与非隐私保护基线相当的高训练效率和模型准确率。
提出的方法
- 设计一种基于混合功能加密方案的隐私计算框架,专门针对 DNN 中的内积和矩阵乘法操作进行优化。
- 利用功能加密实现对加密数据的计算而无需解密,确保数据在云服务提供商处保持机密。
- 将 DNN 训练分解为安全协议,用于关键操作如前向传播和反向传播,使用功能加密实现线性代数原语。
- 集成支持多个不可信数据源之间水平和垂直数据划分的协议。
- 优化协议栈以最小化通信和计算开销,尤其针对大规模数据集。
- 利用功能加密在特定操作上的高效性,避免全同态加密带来的性能瓶颈。
实验结果
研究问题
- RQ1能否构建一个隐私保护的 DNN 训练框架,支持多个不可信数据源的水平和垂直数据划分?
- RQ2如何高效地将功能加密应用于加密环境下的核心 DNN 操作,如矩阵乘法和内积?
- RQ3与现有的同态加密或 SMC 基础方法相比,加密 DNN 训练的训练时间能减少多少?
- RQ4在隐私保护设置下,模型深度或复杂度是否显著影响训练性能?
- RQ5该框架能否在确保强隐私保障的同时,保持与非加密训练相当的模型准确率?
主要发现
- 与现有隐私保护框架相比,NN-EMD 将训练时间减少了 97%,显著提升了效率。
- 该框架在 MNIST 数据集上的模型准确率与非加密训练相当,证明了其强大的实用性。
- 无论神经网络深度或复杂度如何,训练时间均保持稳定且高效,与传统方法形成鲜明对比。
- 该系统支持来自多个不可信数据源的水平和垂直数据划分,支持更广泛的应用部署。
- 混合功能加密的使用使得在加密数据上进行安全计算成为可能,且云服务提供商无需解密数据。
- 该框架提供了强大的隐私保障,保护训练和推理数据免受第三方云基础设施的泄露。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。