Skip to main content
QUICK REVIEW

[논문 리뷰] Google COVID-19 Search Trends Symptoms Dataset: Anonymization Process Description (version 1.0)

Shailesh Bavadekar, Andrew M. Dai|arXiv (Cornell University)|2020. 09. 02.
Privacy-Preserving Technologies in Data참고 문헌 2인용 수 16
한 줄 요약

이 논문은 Google 코로나19 검색 트렌드 증상 데이터셋의 익명화 과정을 상세히 기술하며, 개인의 검색 개인정보를 보호하기 위해 $\epsilon$-차별적 프라이버시를 사용하고 $\epsilon = 1.68$로 설정하여 약 400개의 증상에 대해 다중 지리적 및 시간적 해상도에서 집계된 정규화된 검색 빈도 트렌드를 공개합니다. 이 방법은 차별적 프라이버시와 후처리를 결합하여 데이터 유용성과 신뢰성을 확보하며, 익명화된 데이터의 품질에 따라 일일 또는 주간 해상도 간의 동적 결정을 수행합니다.

ABSTRACT

This report describes the aggregation and anonymization process applied to the initial version of COVID-19 Search Trends symptoms dataset (published at https://goo.gle/covid19symptomdataset on September 2, 2020), a publicly available dataset that shows aggregated, anonymized trends in Google searches for symptoms (and some related topics). The anonymization process is designed to protect the daily symptom search activity of every user with $\varepsilon$-differential privacy for $\varepsilon$ = 1.68.

연구 동기 및 목표

  • 개인 사용자 데이터를暴露하지 않고도 코로나19 증상과 관련된 집계된 Google 검색 트렌드를 공개하기 위한 프라이버시 보장 방법을 개발하는 것.
  • 모든 사용자의 증상 검색 활동이 $\epsilon = 1.68$로 설정된 공식적인 차별적 프라이버시 보장을 통해 보호되도록 보장하는 것.
  • 익명화된 데이터 신뢰성에 기반해 일일 또는 주간 시간 해상도를 동적으로 선택하여 데이터 유용성을 유지하는 것.
  • 추가 프라이버시 예산을 소모하지 않고도 노이즈로 인한 높은 불확실성을 가진 불신뢰성 있는 지표를 제거하는 것.
  • 연구자와 공중보건 전문가가 패닉 기간 동안 증상 검색 패턴을 연구할 수 있도록 확장 가능한, 공개 가능한 데이터셋을 제공하는 것.

제안 방법

  • 데이터셋은 차별적 프라이버시를 사용하여 구성되며, 원시 증상 및 정규화 수를 보정하기 위해 라플라스 노이즈를 추가하여 $\epsilon$-차별적 프라이버시를 확보하고 $\epsilon = 1.68$로 설정합니다.
  • 원시 증상 및 정규화 수는 기여 제한을 통해 사전에 범위를 제한하여 개인의 영향력을 출력에 제한합니다.
  • 익명화된 수치 $A$(증상)와 $B$(정규화)를 사용하여 $c \cdot \max\{(A/B), 0\}$ 방식으로 정규화된 검색 빈도를 계산합니다. 여기서 $c$는 지역별 스케일링 요소입니다.
  • 익명화된 수치 $A$와 $B$로부터 신뢰구간 $[l, r]$을 계산하여 진짜 비율 $a^*/b^*$가 관측된 비율의 25% 이내에 있을 확률가 50% 이상인지 평가합니다.
  • 신뢰구간이 관측된 비율 $A/B$에서 $\pm 25\%$ 이내에 포함되지 않는 지표는 제거되며, 이는 추가 프라이버시 비용 없이도 신뢰성 확보를 가능하게 합니다.
  • 일일 또는 주간 해상도 결정은 익명화된 정규화 수치를 사용하여 지역별 검색 빈도 순으로 정렬하고, 최근 20개 지역에 대해 윤활식 다수결 규칙을 적용하여 이질적 값의 영향을 방지합니다.

실험 결과

연구 질문

  • RQ1대규모 검색 트렌드 데이터를 공개할 때 공식적인 프라이버시 보장 조건을 충족하면서도 개인의 프라이버시를 어떻게 보장할 수 있는가?
  • RQ2다양한 시간 해상도에서 증상 검색 트렌드를 공개할 경우, 데이터 유용성과 프라이버시 간의 최적의 균형은 무엇인가?
  • RQ3노이즈로 인한 높은 불확실성을 가진 불신뢰성 있는 데이터 포인트는 어떻게 식별하고 제거할 수 있는가, 이 과정에서 프라이버시가 손상되지 않도록 하는가?
  • RQ4일일 또는 주간 해상도 결정 과정이 추가 프라이버시 예산을 소모하지 않는 메커니즘은 무엇인가?
  • RQ5시간적 시계열 검색 데이터에 대해 차별적 프라이버시를 적용하면서도 공공 보건 연구의 해석 가능성과 사용성을 유지하는 방법은 무엇인가?

주요 결과

  • 익명화 과정은 $\epsilon$-차별적 프라이버시를 $\epsilon = 1.68$로 달성하여 개인 사용자에 대한 강력한 프라이버시 보장을 확보합니다.
  • 익명화된 데이터 품질에 기반해 일일 또는 주간 시간 해상도를 동적으로 선택하며, 일일 지표의 절반 이상이 신뢰성 없을 경우 주간 해상도를 우선시합니다.
  • 3km² 이상의 최소 지역 크기를 기준으로 국가, 주, 카운티 수준의 다중 지리적 수준에서 총 400개의 증상(기침, 발열, 호흡 곤란 포함)을 포함합니다.
  • 신뢰구간 기반 신뢰성 검사로 진짜 값의 25% 이내에 있을 가능성이 최소 50% 이상인 지표만 공개되어 데이터 신뢰성 향상이 이루어집니다.
  • 해상도 결정 과정은 오직 익명화된 데이터만 사용하므로, 초기 $\epsilon = 1.68$ 외에 추가 프라이버시 예산을 소모하지 않습니다.
  • 스케일링 요소 $c$는 오직 노이즈가 있는 수치에서만 계산되며 지역별로 고정되므로, 향후 공개 시 정규화 척도에서 100을 초과하는 값도 프라이버시 비용 없이 제공할 수 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.