[论文解读] Oblivious Sampling Algorithms for Private Data Analysis
本文提出了一种基于可信执行环境(TEEs)和新颖的不经意采样算法的私有采样查询框架,以在数据分析过程中确保强大的差分隐私保证。通过设计无内存访问模式泄露的无放回采样和泊松采样的变体,该框架在保持与混洗方法相当的模型准确率的同时,显著降低了隐私损失——在MNIST和CIFAR-10上的实验表明,相同准确率下隐私预算(ε)最高可降低5.5倍。
We study secure and privacy-preserving data analysis based on queries executed on samples from a dataset. Trusted execution environments (TEEs) can be used to protect the content of the data during query computation, while supporting differential-private (DP) queries in TEEs provides record privacy when query output is revealed. Support for sample-based queries is attractive due to \emph{privacy amplification} since not all dataset is used to answer a query but only a small subset. However, extracting data samples with TEEs while proving strong DP guarantees is not trivial as secrecy of sample indices has to be preserved. To this end, we design efficient secure variants of common sampling algorithms. Experimentally we show that accuracy of models trained with shuffling and sampling is the same for differentially private models for MNIST and CIFAR-10, while sampling provides stronger privacy guarantees than shuffling.
研究动机与目标
- 为解决在使用TEEs时,内存访问模式可能泄露样本索引的问题,以保护数据隐私。
- 设计安全、数据无关的采样算法,即使在不受信任的TEEs环境中,也能隐藏采样数据记录的索引。
- 评估基于采样的方法在差分隐私机器学习中是否比混洗提供更强的隐私保证。
- 提供一个端到端的安全隐私保护查询框架,防止TEEs主机和合谋的数据科学家访问数据。
提出的方法
- 设计一种新的无放回采样的不经意采样算法,确保内存访问模式不会泄露样本索引。
- 开发泊松采样的数据无关变体,以在TEEs中进行批量采样时保护隐私。
- 将采样算法集成到基于TEEs的框架中,支持对加密数据集的差分隐私查询。
- 使用Intel SGX确保代码和数据完整性,并通过认证验证执行环境的正确性和机密性。
- 将采样方法应用于在MNIST和CIFAR-10上训练深度学习模型,与基于混洗的训练方法比较准确率和隐私损失。
- 使用Rényi差分隐私测量总隐私损失(ε),并在不同采样方法与混洗之间进行比较。
实验结果
研究问题
- RQ1能否设计出在TEEs中隐藏样本索引的不经意采样算法,使其不通过内存访问模式泄露?
- RQ2在差分隐私机器学习中,无放回采样或泊松采样是否比混洗提供更强的隐私保证?
- RQ3采样方法的选择如何影响深度神经网络私有训练中的模型准确率和隐私损失(ε)?
- RQ4能否高效地将安全采样集成到基于TEEs的框架中,以支持具有强端到端隐私保证的私有数据分析?
主要发现
- 所提出的不经意采样算法成功防止了在不受信任的TEEs环境中通过内存访问模式泄露样本索引。
- 在相同训练轮数下,无放回采样(SWO)在MNIST上的总隐私损失为ε = 2.13,在CIFAR-10上为ε = 4.89,显著低于混洗方法(ε = 9.39)。
- 泊松采样在MNIST上实现了ε = 0.82的总隐私损失,为所有测试方法中最低,同时保持了相近的模型准确率。
- SWO和泊松采样的模型准确率与混洗方法几乎相同:在MNIST上分别为97.43%(SWO)和97.5%(混洗),在CIFAR-10上分别为79.0%(SWO)和79.6%(混洗)。
- 结果证实,基于采样的训练相比混洗提供了更强的隐私放大效果,尤其在CIFAR-10上,相同准确率下ε最高可降低5.5倍。
- 更小的批量大小进一步降低了隐私损失,证实了采样在最小化差分隐私学习中ε值方面的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。