[논문 리뷰] Google COVID-19 Vaccination Search Insights: Anonymization Process Description
이 논문은 개인 검색 기록의 기밀을 보장하면서도 유용한 집계 추세를 유지하는 방식으로 Google의 코로나19 백신 접종 검색 인사이트를 공개하기 위해 사용된 차별적 비밀보장 기반 익명화 과정을 기술한다. 이 방법은 $\varepsilon=2.19$ 및 $\delta=10^{-5}$로 설정된 $(\varepsilon,\delta)$-차별적 비밀보장 기반으로 적용되며, 수치를 정규화하고 신뢰할 수 없는 데이터 포인트를 제거하며, 사용성에 맞게 결과를 스케일링하여, 미국 내 지리적 지역별로 백신 관련 검색 추세에 대한 공개 가능하고 기밀이 보장된 데이터셋을 생성한다.
This report describes the aggregation and anonymization process applied to the COVID-19 Vaccination Search Insights (published at http://goo.gle/covid19vaccinationinsights), a publicly available dataset showing aggregated and anonymized trends in Google searches related to COVID-19 vaccination. The applied anonymization techniques protect every user's daily search activity related to COVID-19 vaccinations with $(\varepsilon, δ)$-differential privacy for $\varepsilon = 2.19$ and $δ= 10^{-5}$.
연구 동기 및 목표
- 공중보건 연구자 및 기관이 코로나19 백신 접종에 대한 대중의 관심을 실시간으로 지역 기반으로 확인하고 기밀이 보장된 데이터를 확보할 수 있도록 하는 것.
- 집계된 검색 데이터에 공식적인 차별적 비밀보장 보장을 적용하여 개인 사용자의 검색 기록 기밀을 보호하는 것.
- 신뢰성 필터링 및 정규화를 통해 노이즈 영향을 최소화하여 데이터의 유용성을 확보하는 것.
- 표준화된 스케일링을 통해 지역 간 및 시간 간 비교가 가능한 검색 추세를 보장하는 것.
- 다양한 지리적 및 주제적 세분성 수준에서 비밀보장 예산을 신중히 관리하여 데이터 정확성과 기밀 보장을 동시에 유지하는 것.
제안 방법
- 원시 Google 검색 쿼리 데이터는 반감독 학습 모델을 활용해 세 가지 주제 범주로 분류된다: 백신 접종 의도, 안전성 및 부작용, 기타.
- 각 지역 및 범주별 원시 수치는 $\varepsilon=2.19$ 및 $\delta=10^{-5}$로 설정된 $(\varepsilon,\delta)$-차별적 비밀보장을 충족시키기 위해 가우시안 노이즈로 흐릿하게 처리된다.
- 각 지역의 총 검색량으로 나누어 정규화하여 상대적 인기의 확률적 측정치를 도출한다.
- 낮은 수치로 인해 높은 불확실성을 가지는 신뢰할 수 없는 데이터 포인트는, 정규화된 비율에 대한 신뢰구간이 노이즈 추정치에서 최소 80% 확률로 15% 이내에 있지 않을 경우 제거된다.
- 2021년 1월에서 5월 사이에 세 개 이하의 데이터 포인트만 있는 지역은 극도로 낮은 데이터 밀도로 인해 최종 데이터셋에서 제외된다.
- 정규화된 값은 모든 지역과 시간대에서 관측된 최대값이 100이 되도록 스케일링되어, 시간, 지역, 범주 간 상대적 비교를 유지한다.
실험 결과
연구 질문
- RQ1대규모 검색 추세 데이터는 개인 사용자 기밀을 훼손하지 않고 어떻게 공개할 수 있는가?
- RQ2사용자 수준의 데이터 기밀을 보호하면서도 공중보건 연구에 유용성을 유지하기 위해 필요한 차별적 비밀보장 예산의 수준은 어느 정도인가?
- RQ3노이즈가 첨가된 차별적 비밀보장 데이터는 어떻게 필터링하여 신뢰할 수 있고 해석 가능한 신호만 유지할 수 있는가?
- RQ4익명화된 검색 추세에서 지역 간 및 시간 간 비교 가능성을 유지하기 위해 어떤 정규화 및 스케일링 기법이 필요한가?
- RQ5작은 지리적 지역에서의 데이터 희소성 문제는 기밀 보장이나 유용성에 영향을 주지 않도록 어떻게 해결할 수 있는가?
주요 결과
- 익명화 과정은 $\varepsilon=2.19$ 및 $\delta=10^{-5}$로 설정된 공식적인 $(\varepsilon,\delta)$-차별적 비밀보장 보장을 통해 개인 검색 활동을 성공적으로 보호하였다.
- 차별적 비밀보장 노이즈 추가 후, 신뢰성 기준에 따라 80%의 데이터 포인트가 유지되었으며, 나머지 부분은 높은 불확실성으로 인해 필터링되었다.
- 2021년 1월에서 5월 사이에 세 개 이하의 데이터 포인트만 있는 지역은 극도로 낮은 데이터 밀도로 인해 제외되었으며, 이는 낮은 교통량 지역의 노이즈를 감소시켰다.
- 총 검색량으로 정규화함으로써 검색 인기의 확률적 해석이 가능해졌고, 이는 시간과 지역 간 유효한 비교를 가능하게 하였다.
- 정규화된 값을 최대값 100으로 스케일링하여 모든 지리적 수준과 범주 간 일관된 시각화 및 해석이 가능해졌다.
- 최종 데이터셋은 개인 데이터 노출 없이도 공중보건 연구에 유용성을 유지하고 있으며, 스케일링 및 필터링 단계에서는 비밀보장 예산이 소모되지 않았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.