Skip to main content
QUICK REVIEW

[论文解读] PAPRIKA: Private Online False Discovery Rate Control

Wanrong Zhang, Gautam Kamath|arXiv (Cornell University)|Feb 27, 2020
Privacy-Preserving Technologies in Data参考文献 14被引用 4
一句话总结

PAPRIKA 提出了一种新颖的差分隐私在线算法,用于在多重假设检验中控制错误发现率(FDR),实现实时决策,同时具备强大的隐私和统计保障。通过结合私有阈值设定与自适应财富管理,该方法在 ε-差分隐私下显著优于朴素的私有化方法,在 FDR 控制和统计效能方面达到最先进水平。

ABSTRACT

In hypothesis testing, a false discovery occurs when a hypothesis is incorrectly rejected due to noise in the sample. When adaptively testing multiple hypotheses, the probability of a false discovery increases as more tests are performed. Thus the problem of False Discovery Rate (FDR) control is to find a procedure for testing multiple hypotheses that accounts for this effect in determining the set of hypotheses to reject. The goal is to minimize the number (or fraction) of false discoveries, while maintaining a high true positive rate (i.e., correct discoveries). In this work, we study False Discovery Rate (FDR) control in multiple hypothesis testing under the constraint of differential privacy for the sample. Unlike previous work in this direction, we focus on the online setting, meaning that a decision about each hypothesis must be made immediately after the test is performed, rather than waiting for the output of all tests as in the offline setting. We provide new private algorithms based on state-of-the-art results in non-private online FDR control. Our algorithms have strong provable guarantees for privacy and statistical performance as measured by FDR and power. We also provide experimental results to demonstrate the efficacy of our algorithms in a variety of data environments.

研究动机与目标

  • 为解决在确保单个数据点差分隐私的前提下,控制在线多重假设检验中错误发现率(FDR)的挑战。
  • 设计一种私有的在线算法,即使在假设被顺序测试且必须立即做出决策的情况下,也能保持高统计效能和强 FDR 控制能力。
  • 克服先前离线私有 FDR 方法的局限性,这些方法需要预先获取所有 p 值,这在流式处理或自适应数据分析场景中不切实际。
  • 在在线设置中,为隐私(ε-差分隐私)和统计性能(FDR 与效能)提供可证明的保障。
  • 通过实证验证该算法在包括伯努利分布和截断指数分布在内的多种数据分布下的鲁棒性与准确性。

提出的方法

  • 该方法通过引入报告噪声最小值机制和私有阈值策略,将非私有的在线 FDR 处理流程(如 SAFFRON)扩展至差分隐私设置。
  • 提出一种基于私有财富的机制,根据累积的隐私损失和观测到的 p 值动态调整拒绝阈值。
  • 引入一个偏移参数 A,用于校准私有阈值设定过程,平衡 FDR 控制与统计效能。
  • 该算法使用私有版本的 Benjamini-Hochberg 过程,通过一系列私有比较处理噪声 p 值,以确定拒绝决策。
  • 理论分析表明,期望 FDR 被界定为 α + δt,其中 δ 为隐私损失参数,确保 FDR 始终保持在目标水平内。
  • 该方法应用后处理不变性与高级组合定理,以在连续查询中维持隐私保障。

实验结果

研究问题

  • RQ1能否设计一种差分隐私在线 FDR 控制算法,在确保个体数据点隐私的同时保持强大的统计性能?
  • RQ2在 FDR 与统计效能方面,私有在线 FDR 控制的性能与非私有及朴素私有化基线相比如何?
  • RQ3偏移参数 A 对私有在线设置中 FDR 控制与统计效能之间权衡的影响是什么?
  • RQ4私有在线 FDR 控制能否有效应用于伯努利分布和截断指数分布等现实世界数据分布?
  • RQ5与朴素私有化方法(如在 p 值上添加拉普拉斯噪声)相比,私有阈值设定与财富管理机制在 FDR 与效能方面的表现如何?

主要发现

  • PAPRIKA 实现了目标水平 α 内的 FDR 控制,经验 FDR 被限制在 α + δt 以内,展现出强大的理论隐私保障。
  • 在伯努利分布和截断指数分布的实验中,PAPRIKA 在强信号条件下保持了高达 80% 的统计效能,同时在 ε=5 时将 FDR 控制在 5% 以下。
  • 与使用拉普拉斯噪声对 SAFFRON 进行朴素私有化的 LapSAFFRON 相比,PAPRIKA 在 FDR 控制与效能方面均显著更优,尤其在弱信号条件下(θi=1.90)表现突出。
  • 偏移参数 s(与 A 相关)的选择对 FDR-效能权衡具有决定性影响:较大的 s 值会减少拒绝数量,从而改善 FDR 控制但降低统计效能。
  • PAPRIKA 中的财富与拒绝阈值轨迹与非私有的 SAFFRON 非常接近,证实了私有决策与最优非私有决策保持一致。
  • PAPRIKA AI(采用自适应 λj=αj)相较于使用固定 λj=0.2 的 PAPRIKA 表现更优,尤其在高信号场景(θi=2.00)中优势明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。