Skip to main content
QUICK REVIEW

[论文解读] A Members First Approach to Enabling LinkedIn's Labor Market Insights at Scale

Ryan Rogers, Adrian Rivera Cardoso|arXiv (Cornell University)|Oct 27, 2020
Privacy-Preserving Technologies in Data参考文献 9被引用 4
一句话总结

本文提出了一种以成员为中心的方法,通过差分隐私保护用户数据,实现LinkedIn劳动力市场洞察的规模化发布。该方法利用差分隐私算法(如UnkLap和UnkGumbel),按国家、地区和行业发布顶尖雇主、职位和技能信息,确保$(\varepsilon,\delta)$-差分隐私,其中$\varepsilon \leq 4.8$且$\delta = 10^{-10}$,在新冠疫情背景下实现了公众信任与数据实用性的平衡。

ABSTRACT

We describe the privatization method used in reporting labor market insights from LinkedIn's Economic Graph, including the differentially private algorithms used to protect member's privacy. The reports show who are the top employers, as well as what are the top jobs and skills in a given country/region and industry. We hope this data will help governments and citizens track labor market trends during the COVID-19 pandemic while also protecting the privacy of our members.

研究动机与目标

  • 在新冠疫情背景下,从LinkedIn的经济图谱中实现大规模、保护隐私的劳动力市场洞察。
  • 在不重新识别个人成员的情况下,解决发布聚合就业趋势时的隐私问题。
  • 通过正式的差分隐私保证,确保关于顶尖雇主、职位和技能的报告在准确性和隐私性之间取得平衡。
  • 通过部署可扩展、可审计的隐私保护系统来发布公共数据,从而维护成员信任。

提出的方法

  • 采用事件级差分隐私,其中相邻数据集之间最多仅相差一个雇佣事件。
  • 对每个雇主、职位或技能的雇佣人数应用UnkLap^Δ, d算法,并加入拉普拉斯噪声以实现数据化。
  • 使用UnkGumbel^k, d算法并加入Gumbel噪声,以在不暴露真实计数的情况下私密地选择并排序前20名结果。
  • 为噪声计数设置最低阈值(例如约260),以确保统计显著性并防止低计数条目导致的信息泄露。
  • 在应用差分隐私前,对技能数据进行TF-IDF预处理,以减少常见术语(如'Microsoft Word')的主导影响。
  • 采用3个月的时间窗口处理招聘数据,并通过在分子和分母上均加入拉普拉斯噪声,计算出经过差分隐私保护的比率。

实验结果

研究问题

  • RQ1如何在确保个人LinkedIn成员强隐私保障的前提下,大规模发布劳动力市场洞察?
  • RQ2哪些差分隐私算法可用于发布顶尖雇主、职位和技能信息,同时不损害数据实用性?
  • RQ3如何在多个查询(如雇主、职位、技能)之间分配隐私预算,以维持端到端$(\varepsilon,\delta)$-差分隐私?
  • RQ4在分析技能频率时,数据预处理(如TF-IDF)对差分隐私保证有何影响?
  • RQ5当底层直方图具有无限制敏感度时,如何实现私密的top-k选择?

主要发现

  • 顶尖雇主报告为$(1.2, 10^{-10})$-差分隐私,确保强隐私保护,重新识别风险极低。
  • 顶尖职位报告为$(4.8, 4 \times 10^{-10})$-差分隐私,通过精细的噪声校准控制了隐私泄露。
  • 顶尖技能报告采用UnkGumbel^k, d算法,$\varepsilon = 0.1$,$\delta = 10^{-10}$,并设置约260的阈值,以确保稳健性。
  • 超过95%的用户在任意3个月窗口内最多被雇佣一次,这支持采用事件级隐私而非用户级隐私。
  • 在计数和比率上均使用拉普拉斯噪声,确保基于百分比的指标(如雇佣占比)也具备差分隐私特性。
  • 尽管预处理步骤本身不具备差分隐私特性,但最终的技能计数直方图通过Gumbel噪声得到保护,为发布的结果提供了强有力的隐私保障。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。