Skip to main content
QUICK REVIEW

[논문 리뷰] Context-Aware Local Differential Privacy

Jayadev Acharya, Keith Bonawitz|arXiv (Cornell University)|2019. 10. 31.
Privacy-Preserving Technologies in Data참고 문헌 33인용 수 5
한 줄 요약

이 논문은 데이터 민감도에 따라 가변적인 프라이버시 예산을 할당하는 컨텍스트 인식 지역적 차별적 프라이버시(LDP) 프레임워크를 소개한다. 이는 분포 추정에서 유틸리티를 향상시킨다. 이진 도메인에 대해서는 보편적으로 최적의 프라이버티제이션 기법을 제공하고, $k$-항 도메인에 대해서는 블록 구조화된 LDP 및 하이-로우 LDP 모델을 제안하며, 컨텍스트 인식 LDP가 기존의 LDP에 비해 샘플 복잡도를 감소시키고 정확도를 향상시켜 지리적 위치 및 웹 브라우징 응용 분야에서 특히 유리하다고 보여준다.

ABSTRACT

Local differential privacy (LDP) is a strong notion of privacy for individual users that often comes at the expense of a significant drop in utility. The classical definition of LDP assumes that all elements in the data domain are equally sensitive. However, in many applications, some symbols are more sensitive than others. This work proposes a context-aware framework of local differential privacy that allows a privacy designer to incorporate the application's context into the privacy definition. For binary data domains, we provide a universally optimal privatization scheme and highlight its connections to Warner's randomized response (RR) and Mangat's improved response. Motivated by geolocation and web search applications, for $k$-ary data domains, we consider two special cases of context-aware LDP: block-structured LDP and high-low LDP. We study discrete distribution estimation and provide communication-efficient, sample-optimal schemes and information-theoretic lower bounds for both models. We show that using contextual information can require fewer samples than classical LDP to achieve the same accuracy.

연구 동기 및 목표

  • 기존의 지역적 차별적 프라이버시(LDP)는 모든 데이터 요소를 동일하게 민감하다고 간주하여 유틸리티 비용이 높다는 문제를 해결하기 위해.
  • 응용 분야의 특수한 컨텍스트(예: 데이터 민감도 또는 구조)에 따라 프라이버시 파라미터를 다양화할 수 있는 통합된 컨텍스트 인식 LDP 프레임워크를 개발하기 위해.
  • 블록 구조화된 LDP 및 하이-로우 LDP라는 두 가지 실용적인 모델 하에서 프라이버티제이션 및 추정 기법의 샘플 복잡도와 통신 효율성을 규명하기 위해.
  • 컨텍스트 정보를 통합함으로써, 기존의 LDP에 비해 주어진 추정 정확도를 달성하기 위한 샘플 수를 줄일 수 있음을 입증하기 위해.

제안 방법

  • 모든 도메인 요소 쌍에 대해 프라이버시 손실 한계를 정의하는 일반적인 컨텍스트 인식 LDP 정의를 제안하여, 임의의 민감도 수준을 허용한다.
  • 이진 도메인에 대해서는 Warner의 무작위 응답과 Mangat의 개선된 응답 사이를 보간하는 보편적으로 최적의 프라이버티제이션 메커니즘을 유도한다.
  • 데이터 도메인이 블록으로 분할되고, 오직 블록 내 신원 보호만 이루어지는 블록 구조화된 LDP를 도입한다. 이는 지리적 위치 및 인구 조사 데이터에 기인한다.
  • 민감한 요소의 일부만 보호가 필요한 하이-로우 LDP를 도입하며, 민감하고 비민감한 URL이 혼합된 웹 브라우징에 적용 가능하다.
  • 두 모델 모두 통신 및 계산 효율적인 프라이버티제이션 및 추정 기법을 설계하였으며, 샘플 복잡도에 대한 이론적 보장을 제공한다.
  • 정보 이론적 하한과 카이제곱 발산 분석을 활용하여 컨텍스트 인식 LDP 하에서 추정 오차의 날카로운 하한을 확립한다.

실험 결과

연구 질문

  • RQ1데이터 민감도를 활용함으로써, 기존의 LDP에 비해 분포 추정의 샘플 복잡도를 줄일 수 있는가?
  • RQ2컨텍스트 인식 LDP 하에서 이진 도메인의 최적 프라이버티제이션 메커니즘은 무엇이며, Warner의 응답 및 Mangat의 응답과의 관계는 어떻게 되는가?
  • RQ3블록 구조화된 LDP는 지리적 위치와 같이 도시 내 정확한 위치만을 은폐해야 하는 응용 분야에서 유틸리티를 어떻게 향상시키는가?
  • RQ4민감한 요소의 일부만 보호되는 하이-로우 LDP 하에서 분포 추정의 이론적 샘플 복잡도는 어떻게 되는가?
  • RQ5Gowalla 체크인과 같은 실제 데이터셋에서, 기존의 LDP에 비해 컨텍스트 인식 LDP가 유틸리티 측면에서 얼마나 향상되는가?

주요 결과

  • 이진 도메인에 대해서는 제안된 보편적으로 최적의 프라이버티제이션 기법이 프라이버시와 유틸리티 사이의 최선의 트레이드오프를 달성하며, Warner의 응답과 Mangat의 응답을 일반화한다.
  • 블록 구조화된 LDP 하에서 $k$-항 분포 추정의 샘플 복잡도는 기존의 LDP에 비해 크게 감소하며, 블록 수 $m$이 증가할수록 더욱 두드러진다.
  • $k=1000$, $\varepsilon=1$, $m=100$ 조건의 시뮬레이션 실험에서, 블록 구조화된 LDP는 $d_{TV}$ 오차 0.082를 달성했고, 기존의 LDP는 0.591을 기록했다.
  • 43,750개의 위치를 포함하는 Gowalla 데이터셋에서, 블록 구조화된 LDP는 $m_1=25, m_2=70$ 조건에서 $d_{TV}$ 오차를 기존 LDP의 0.591에서 0.082로 감소시켰다.
  • 이론적 분석 결과, 블록 구조화된 LDP 하에서 샘플 복잡도는 $\Theta\left(\frac{\sum k_i^2}{\alpha^2 \varepsilon^2}\right)$로 스케일링되며, 블록이 작을 경우 기존 LDP의 $\Theta\left(\frac{k^2}{\alpha^2 \varepsilon^2}\right)$보다 낮다.
  • 실험 결과, 블록 수를 늘리면(즉, 더 세밀한 분할을 하면) 추정 정확도가 향상됨을 확인하였으며, 이는 컨텍스트 인식 LDP의 이론적 성과를 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.