QUICK REVIEW
[论文解读] Google COVID-19 Search Trends Symptoms Dataset: Anonymization Process Description (version 1.0)
Shailesh Bavadekar, Andrew M. Dai|arXiv (Cornell University)|Sep 2, 2020
Privacy-Preserving Technologies in Data参考文献 2被引用 16
一句话总结
本文详细介绍了 Google COVID-19 搜索趋势症状数据集的匿名化过程,该过程采用 $\epsilon$-差分隐私($\epsilon = 1.68$),在保护个人搜索隐私的同时,发布约 400 种症状在多种地理和时间粒度下的聚合、归一化搜索量趋势。该方法结合差分隐私与事后处理,以确保数据的可用性和可靠性,包括根据匿名化数据质量动态决定每日或每周粒度。
ABSTRACT
This report describes the aggregation and anonymization process applied to the initial version of COVID-19 Search Trends symptoms dataset (published at https://goo.gle/covid19symptomdataset on September 2, 2020), a publicly available dataset that shows aggregated, anonymized trends in Google searches for symptoms (and some related topics). The anonymization process is designed to protect the daily symptom search activity of every user with $\varepsilon$-differential privacy for $\varepsilon$ = 1.68.
研究动机与目标
- 开发一种隐私保护方法,用于发布与 COVID-19 症状相关的聚合 Google 搜索趋势数据,而不会暴露个体用户数据。
- 确保每位用户症状搜索活动均受到正式差分隐私保证的保护,其中 $\epsilon = 1.68$。
- 通过基于匿名化数据可靠性动态选择每日或每周时间粒度,保持数据可用性。
- 在不消耗额外隐私预算的情况下,移除因噪声导致不确定性较高的不可靠指标。
- 为研究人员和公共卫生专家提供可扩展、公开可用的数据集,用于研究疫情期间的症状搜索模式。
提出的方法
- 使用差分隐私构建数据集,向原始症状和归一化计数添加拉普拉斯噪声,以确保 $\epsilon$-差分隐私,且 $\epsilon = 1.68$。
- 首先通过贡献限制对原始症状和归一化计数进行边界限定,以限制个体对输出的影响。
- 使用匿名化计数 $A$(症状)和 $B$(归一化)通过公式 $c \cdot \max\{(A/B), 0\}$ 计算归一化搜索量,其中 $c$ 为特定区域的缩放因子。
- 从 $A$ 和 $B$ 计算置信区间 $[l, r]$,以评估真实比率 $a^*/b^*$ 以至少 50% 的概率落在观测比率的 ±25% 范围内。
- 若置信区间未落在 $\pm 25\%$ 的观测比率 $A/B$ 范围内,则丢弃该指标,从而在不增加隐私成本的前提下确保可靠性。
- 通过使用匿名化归一化计数对区域按搜索量进行排序,并采用最近 20 个区域的滚动多数规则,动态决定每日或每周粒度。
实验结果
研究问题
- RQ1如何在使用正式隐私保证的前提下,发布大规模搜索趋势数据,同时保护个人隐私?
- RQ2在不同时间粒度下发布症状搜索趋势时,如何实现数据可用性与隐私保护之间的最佳平衡?
- RQ3如何识别并移除因噪声导致高不确定性的不可靠数据点,同时不损害隐私?
- RQ4何种机制可确保时间粒度选择决策不消耗额外的隐私预算?
- RQ5如何在保持公共卫生研究可解释性和可用性的前提下,将差分隐私应用于时间序列搜索数据?
主要发现
- 匿名化过程实现了 $\epsilon$-差分隐私,且 $\epsilon = 1.68$,为个体用户提供了强有力的隐私保障。
- 该方法根据匿名化数据质量动态选择每日或每周时间粒度,当超过一半的每日指标不可靠时,优先采用每周粒度。
- 共涵盖 400 种症状(包括咳嗽、发热和呼吸困难等),覆盖多种地理层级(国家、州、县),最小区域面积为 3km²。
- 基于置信区间的可靠性检查确保仅发布那些至少有 50% 概率落在真实值 ±25% 范围内的指标,从而提升数据可信度。
- 粒度决策过程仅使用匿名化数据,确保在初始 $\epsilon = 1.68$ 之外不消耗额外隐私预算。
- 缩放因子 $c$ 仅从噪声计数中计算得出,并在每个区域固定,使得未来发布可在归一化尺度上超过 100 而不产生额外隐私成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。