Skip to main content
QUICK REVIEW

[论文解读] Hyperparameter Tuning with Renyi Differential Privacy

Nicolas Papernot, Thomas Steinke|arXiv (Cornell University)|Oct 7, 2021
Privacy-Preserving Technologies in Data参考文献 26被引用 6
一句话总结

本文提出了一种基于Rényi差分隐私(RDP)的差分隐私超参数调优框架,以在迭代模型优化过程中控制隐私泄露。通过从训练运行中随机采样一定数量并选择最佳模型,该方法实现了隐私保证随运行次数对数增长——显著优于线性组合界限——从而在不损害模型效用的前提下实现了私有化模型选择。

ABSTRACT

For many differentially private algorithms, such as the prominent noisy stochastic gradient descent (DP-SGD), the analysis needed to bound the privacy leakage of a single training run is well understood. However, few studies have reasoned about the privacy leakage resulting from the multiple training runs needed to fine tune the value of the training algorithm's hyperparameters. In this work, we first illustrate how simply setting hyperparameters based on non-private training runs can leak private information. Motivated by this observation, we then provide privacy guarantees for hyperparameter search procedures within the framework of Renyi Differential Privacy. Our results improve and extend the work of Liu and Talwar (STOC 2019). Our analysis supports our previous observation that tuning hyperparameters does indeed leak private information, but we prove that, under certain assumptions, this leakage is modest, as long as each candidate training run needed to select hyperparameters is itself differentially private.

研究动机与目标

  • 为解决在使用DP-SGD等差分隐私训练算法时,超参数调优中被忽视的隐私风险。
  • 正式量化通过非私有调优过程,超参数选择如何泄露训练数据中个体的隐私信息。
  • 开发一种保持强隐私保证的隐私保护型超参数搜索机制,适用于Rényi差分隐私(RDP)框架。
  • 在先前工作的基础上,实现隐私损失界限随训练运行次数对数增长而非线性增长。
  • 提供一种实用且分析严谨的差分隐私模型选择方法,通过截断随机重复训练运行实现。

提出的方法

  • 该方法使用随机数量的训练运行,其中运行次数从具有截断阈值的分布中抽取,以控制隐私泄露。
  • 应用Rényi差分隐私(RDP)分析整体超参数调优过程的隐私损失,利用RDP框架获得比传统DP更紧致的边界。
  • 该方法将训练运行次数与截断点m关联,确保高值运行次数的期望较小,从而控制隐私成本。
  • 通过概率生成函数(PGFs)及其导数,推导出通用的隐私边界,用于比较相邻数据集之间的隐私损失。
  • 利用后处理不变性与Rényi散度,界定从多个私有运行中选择最佳模型的隐私损失。
  • 引入一种截断分布以表示运行次数,从而实现依赖于分布尾部行为的更紧致隐私边界。

实验结果

研究问题

  • RQ1基于非私有模型评估的超参数调优是否会泄露训练数据中个体的隐私信息?
  • RQ2从多个差分隐私训练运行中选择最佳模型的隐私成本是多少?
  • RQ3我们能否实现隐私保证随训练运行次数呈次线性增长的超参数调优?
  • RQ4如何设计一种在保持强隐私的同时最小化效用损失的超参数调优过程?
  • RQ5在随机超参数搜索中,隐私参数与训练运行次数尾部重尾程度之间的权衡是什么?

主要发现

  • 基于非私有训练运行的超参数调优可能泄露隐私信息,尤其是在训练数据中的异常值显著影响最优超参数时。
  • 当使用随机运行次数时,从多个差分隐私训练运行中选择最佳模型的隐私成本随运行次数对数增长,而非线性增长。
  • 当使用几何分布且截断点足够小时,该方法实现的隐私保证与运行次数无关。
  • 隐私损失边界在概率分布中大运行次数概率较小时,比标准组合定理更紧致。
  • 该框架可在不退化为近似DP的前提下实现私有化超参数调优,保持更强的隐私保证。
  • 当超过截断阈值的期望运行次数较小时,推导出的边界是有效的,这一条件在截断值足够大时成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。