Skip to main content
QUICK REVIEW

[论文解读] Google COVID-19 Vaccination Search Insights: Anonymization Process Description

Shailesh Bavadekar, Adam Boulanger|arXiv (Cornell University)|Jul 2, 2021
Privacy-Preserving Technologies in Data参考文献 3被引用 8
一句话总结

本文详细描述了基于差分隐私的匿名化流程,用于发布 Google 的 COVID-19 疫苗接种搜索洞察数据,确保个体搜索隐私的同时保留了有用的聚合趋势。该方法采用 $(\varepsilon,\delta)$-差分隐私,其中 $\varepsilon=2.19$ 且 $\delta=10^{-5}$,对计数进行归一化处理,剔除不可靠的数据点,并对结果进行缩放以提升可用性,最终生成一个公开可获取、隐私保护的美国地理区域疫苗接种相关搜索趋势数据集。

ABSTRACT

This report describes the aggregation and anonymization process applied to the COVID-19 Vaccination Search Insights (published at http://goo.gle/covid19vaccinationinsights), a publicly available dataset showing aggregated and anonymized trends in Google searches related to COVID-19 vaccination. The applied anonymization techniques protect every user's daily search activity related to COVID-19 vaccinations with $(\varepsilon, δ)$-differential privacy for $\varepsilon = 2.19$ and $δ= 10^{-5}$.

研究动机与目标

  • 为公共卫生研究人员和组织提供及时、本地化且隐私保护的公众对 COVID-19 疫苗接种兴趣的数据。
  • 通过对聚合搜索数据应用正式的差分隐私保证,保护个人用户的搜索隐私。
  • 通过可靠性过滤和归一化最小化噪声影响,确保数据可用性。
  • 通过标准化缩放实现跨区域和跨时间的搜索趋势比较。
  • 通过在多个地理和主题粒度上仔细管理隐私预算,同时保持数据准确性和隐私性。

提出的方法

  • 该数据集源自原始 Google 搜索查询,使用半监督机器学习模型将其分类为三类主题:疫苗接种意愿、安全性和副作用、以及其他类别。
  • 对每个区域和类别的原始计数添加高斯噪声,以满足 $(\varepsilon,\delta)$-差分隐私要求,其中 $\varepsilon=2.19$ 且 $\delta=10^{-5}$。
  • 通过将计数除以每个区域的总搜索量,对计数进行归一化,以获得相对受欢迎程度的概率度量。
  • 若归一化比率的置信区间在至少 80% 的概率下不落在噪声估计值的 15% 范围内,则将不确定性较高的数据点(即低计数导致的不可靠点)剔除。
  • 对于在 2021 年 1 月至 5 月期间数据点少于三个的区域,由于数据极度稀疏,从最终数据集中排除。
  • 将归一化后的数值进行缩放,使所有区域和时间范围内观察到的最大值设为 100,从而在时间、区域和类别之间保持相对比较的一致性。

实验结果

研究问题

  • RQ1如何在不损害个人用户隐私的前提下发布大规模搜索趋势数据?
  • RQ2多大的差分隐私预算足以在保护用户级别数据的同时,保持对公共卫生研究的可用性?
  • RQ3如何对噪声较大的差分隐私数据进行过滤,以仅保留可靠且可解释的信号?
  • RQ4哪些归一化和缩放技术能够保持匿名化搜索趋势在跨区域和跨时间上的可比性?
  • RQ5如何在不损害隐私或可用性的前提下,解决小地理区域中的数据稀疏性问题?

主要发现

  • 匿名化过程成功通过正式的 $(\varepsilon,\delta)$-差分隐私保证保护了个人搜索活动,使用 $\varepsilon=2.19$ 且 $\delta=10^{-5}$。
  • 在添加差分隐私噪声后,80% 的数据点根据可靠性阈值得以保留,其余因不确定性过高而被过滤。
  • 在 2021 年 1 月至 5 月期间数据点少于三个的区域因数据极度稀疏被排除,从而降低了低流量区域的噪声。
  • 通过总搜索量进行归一化,使搜索受欢迎程度具有概率解释性,支持在时间和区域之间的有效比较。
  • 将归一化值缩放至最大值为 100,确保了在所有地理层级和类别中的一致可视化与解释。
  • 最终数据集在确保不暴露任何个人数据且在缩放或过滤步骤中未消耗隐私预算的前提下,保留了对公共卫生研究的可用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。