[논문 리뷰] A Members First Approach to Enabling LinkedIn's Labor Market Insights at Scale
이 논문은 COVID-19 패an드믹 기간 동안 사용자 데이터를 보호하면서도 실행 가능한 노동 시장 트렌드를 발표할 수 있도록, 차별적 프라이버시를 활용한 LinkedIn의 노동 시장 인사이트 스케일링을 위한 멤버 중심 접근법을 제시한다. 이는 UnkLap 및 UnkGumbel와 같은 차별적 프라이버시 알고리즘을 활용하여 국가, 지역, 산업별로 상위 고용주, 직업, 스킬을 공개함으로써 $(\varepsilon,\delta)$-차별적 프라이버시를 $\varepsilon \leq 4.8$ 및 $\delta = 10^{-10}$로 보장하며, 공공 신뢰와 유용성을 동시에 확보한다.
We describe the privatization method used in reporting labor market insights from LinkedIn's Economic Graph, including the differentially private algorithms used to protect member's privacy. The reports show who are the top employers, as well as what are the top jobs and skills in a given country/region and industry. We hope this data will help governments and citizens track labor market trends during the COVID-19 pandemic while also protecting the privacy of our members.
연구 동기 및 목표
- COVID-19 패an드믹 기간 동안 LinkedIn의 경제 그래프에서 대규모로 프라이버시를 보장하는 노동 시장 인사이트를 제공하기 위해.
- 개인 멤버를 재식별하지 않고도 집계된 고용 트렌드를 발표할 때 발생하는 프라이버시 우려를 해결하기 위해.
- 공식적인 차별적 프라이버시 보장을 통해 상위 고용주, 직업, 스킬에 대한 보고서가 정확성과 프라이버시를 동시에 유지하도록 보장하기 위해.
- 공개 데이터 배포를 위한 확장 가능하고 검증 가능한 프라이버시 보장 시스템을 구현함으로써 멤버 신뢰를 유지하기 위해.
제안 방법
- 이벤트 수준의 차별적 프라이버시를 사용하며, 이웃한 데이터셋은 최대 한 건의 채용 이벤트만 다를 수 있다.
- Laplace 노이즈를 사용하여 UnkLap^Δ, d 알고리즘을 적용해 고용주, 직업 또는 스킬 별 채용 수를 프라이버시 보장된 상태로 처리한다.
- Gumbel 노이즈를 사용하여 UnkGumbel^k, d 알고리즘을 적용해 진짜 수를 드러내지 않은 채 상위 20개 결과를 비공식적으로 선택하고 순위를 매긴다.
- 낮은 빈도의 항목에서 유출을 방지하기 위해, 노이즈가 섞인 수의 최소 기준치(예: 약 260)를 설정한다.
- 차별적 프라이버시 적용 이전에 스킬 데이터에 TF-IDF 전처리를 적용하여 일반적인 용어(예: 'Microsoft Word')의 지배도를 줄인다.
- 채용 데이터에 3개월 창을 적용하고, 분자와 분모에 모두 Laplace 노이즈를 적용하여 비공식적인 비율을 통해 백분율을 계산한다.
실험 결과
연구 질문
- RQ1개인 LinkedIn 멤버의 강력한 프라이버시 보장을 확보하면서도 대규모로 노동 시장 인사이트를 공개할 수 있는 방법은 무엇인가?
- RQ2데이터 유용성이 손상되지 않도록 상위 고용주, 직업, 스킬을 공개하기 위해 사용할 수 있는 차별적 프라이버시 알고리즘은 무엇인가?
- RQ3여러 쿼리(예: 고용주, 직업, 스킬) 간에 프라이버시 예산을 어떻게 할당하여 종단 간 $(\varepsilon,\delta)$-차별적 프라이버시를 유지할 수 있는가?
- RQ4스킬 빈도 분석 시, TF-IDF와 같은 데이터 전처리가 차별적 프라이버시 보장에 어떤 영향을 미치는가?
- RQ5기본 히스토GRAM의 민감도가 제한 없이 허용되는 상황에서 어떻게 상위-k 선택을 비공식적으로 수행할 수 있는가?
주요 결과
- 상위 고용주 보고서는 $(1.2, 10^{-10})$-차별적 프라이버시를 보장하여 재식별 위험이 매우 낮고 강력한 프라이버시 보장을 확보한다.
- 상위 직업 보고서는 $(4.8, 4 \times 10^{-10})$-차별적 프라이버시를 적용하며, 노이즈 캘리브레이션을 신중히 조정하여 프라이버시 유출을 통제한다.
- 상위 스킬 보고서는 $\varepsilon = 0.1$, $\delta = 10^{-10}$로 설정된 UnkGumbel^k, d 알고리즘을 사용하며, 약 260의 기준치를 설정하여 강력한 내구성을 확보한다.
- 3개월 창 동안 95% 이상의 사용자는 최대 한 번만 고용되므로, 사용자 수준 프라이버시보다는 이벤트 수준 프라이버시의 사용이 타당하다.
- 카운트와 비율 양쪽에 Laplace 노이즈를 적용함으로써 백분율 기반 지표(예: 고용 비율) 역시 차별적 프라이버시를 보장한다.
- 전처리 단계는 차별적 프라이버시를 보장하지 않지만, 최종 스킬 빈도 히스토GRAM은 Gumbel 노이즈로 보호되어 공개 결과에 대해 강력한 프라이버시 보장을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.