Skip to main content
QUICK REVIEW

[论文解读] U.S. Broadband Coverage Data Set: A Differentially Private Data Release

Mayana Pereira, Kim Allen|arXiv (Cornell University)|Mar 24, 2021
Privacy-Preserving Technologies in Data参考文献 7被引用 5
一句话总结

本文提出了一种在邮编级别实现差分隐私保护的美国宽带覆盖数据集,通过拉普拉斯机制注入噪声以保护个人隐私,同时支持公开使用。该研究引入了一种后处理模拟方法,用于估算误差范围而不产生额外的隐私损失,确保在不同人口规模下数据可用性的透明性。

ABSTRACT

Broadband connectivity is a key metric in today's economy. In an era of rapid expansion of the digital economy, it directly impacts GDP. Furthermore, with the COVID-19 guidelines of social distancing, internet connectivity became necessary to everyday activities such as work, learning, and staying in touch with family and friends. This paper introduces a publicly available U.S. Broadband Coverage data set that reports broadband coverage percentages at a zip code-level. We also explain how we used differential privacy to guarantee that the privacy of individual households is preserved. Our data set also contains error ranges estimates, providing information on the expected error introduced by differential privacy per zip code. We describe our error range calculation method and show that this additional data metric does not induce any privacy losses.

研究动机与目标

  • 解决在邮编级别公开发布宽带接入数据时的隐私-效用权衡问题。
  • 开发一种在保持数据对政策和研究有用性的同时保护个人家庭隐私的方法。
  • 为每个邮编提供透明的误差估计,以量化差分隐私的影响。
  • 确保误差范围估计不因后处理而产生额外的隐私损失,利用后处理免疫性。
  • 通过一种隐私保护、公开可用的数据集,支持公平的宽带资金分配决策。

提出的方法

  • 宽带覆盖估计基于匿名化的微软服务使用数据计算得出,包括设备吞吐量、下载时间以及基于反向IP的邮编解析。
  • 对计数查询(例如,每个邮编的高速连接数量)应用拉普拉斯机制,灵敏度 Δf = 1,使用尺度 λ = 1/ε 以实现 ε-差分隐私。
  • 通过模拟的误差估计过程,为每个邮编独立生成 k 个不同差分隐私计数(H, M, O)样本,使用独立的拉普拉斯噪声,尺度为 1/ε。
  • 对每个邮编,从噪声计数重新计算宽带覆盖估计(BCE),并利用其与真实(非私有)BCE 的差异计算误差度量。
  • 从模拟的误差分布 d^z 中推导出误差度量——平均绝对误差(MAE)、第95百分位误差和平均有符号偏差(MSD)。
  • 所有误差范围计算均在后处理中完成,仅使用差分隐私计数,确保通过后处理免疫性不产生额外隐私损失。

实验结果

研究问题

  • RQ1如何在确保个人家庭隐私的前提下,以邮编级别发布宽带覆盖数据?
  • RQ2差分隐私对不同人口规模邮编中宽带覆盖估计准确率的影响如何?
  • RQ3能否在不引入额外隐私损失的情况下估算差分隐私数据的误差范围?
  • RQ4宽带覆盖估计的误差如何随邮编人口规模变化?
  • RQ5该差分隐私宽带覆盖数据集在政策和研究应用中的效用如何?

主要发现

  • 宽带覆盖数据集以邮编级别提供 ε-差分隐私保护,确保无法通过该数据重新识别个人家庭信息。
  • 通过模拟实现的误差范围估计不产生额外隐私损失,得益于差分隐私的后处理免疫性。
  • 平均绝对误差(MAE)和第95百分位误差随人口规模增加而减小,表明在更大邮编中准确性更高。
  • 平均有符号偏差(MSD)较小,表明差分隐私机制平均引入的偏差可忽略不计。
  • 基于模拟的误差估计方法为每个邮编提供了可靠且透明的误差度量,使用户能够评估数据可靠性。
  • 该数据集通过 OpenDP SmartNoise 库发布,确保差分隐私实现的可复现性与可信度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。