Skip to main content
QUICK REVIEW

[논문 리뷰] Locally Differentially Private Analysis of Graph Statistics

Jacob Imola, Takao Murakami|arXiv (Cornell University)|2020. 10. 17.
Privacy-Preserving Technologies in Data참고 문헌 54인용 수 9
한 줄 요약

이 논문은 신뢰할 수 있는 중재자가 없이도 개인 정보를 보호하는 그래프 통계 분석을 가능하게 하는 국소적 미분_privacy(LDP) 알고리즘을 제안한다. 삼각형과 k-별(subgraph)의 수를 추정하기 위한 LDP 알고리즘을 제시하며, 비상호작용 방법에 비해 추정 오차를 크게 줄이는 이중 라운드 프로토콜을 도입한다. 이는 k-별 수 추정에서 순서 최적의 오차를 달성하고, 실세계 데이터셋인 IMDB와 Orkut에서 상대 오차가 낮게 유지됨(예: ε=1일 때 삼각형의 상대 오차 0.30)을 보여준다.

ABSTRACT

Differentially private analysis of graphs is widely used for releasing statistics from sensitive graphs while still preserving user privacy. Most existing algorithms however are in a centralized privacy model, where a trusted data curator holds the entire graph. As this model raises a number of privacy and security issues -- such as, the trustworthiness of the curator and the possibility of data breaches, it is desirable to consider algorithms in a more decentralized local model where no server holds the entire graph. In this work, we consider a local model, and present algorithms for counting subgraphs -- a fundamental task for analyzing the connection patterns in a graph -- with LDP (Local Differential Privacy). For triangle counts, we present algorithms that use one and two rounds of interaction, and show that an additional round can significantly improve the utility. For $k$-star counts, we present an algorithm that achieves an order optimal estimation error in the non-interactive local model. We provide new lower-bounds on the estimation error for general graph statistics including triangle counts and $k$-star counts. Finally, we perform extensive experiments on two real datasets, and show that it is indeed possible to accurately estimate subgraph counts in the local differential privacy model.

연구 동기 및 목표

  • 신뢰할 수 있는 중재자가 없이도 국소적 미분_privacy(LDP) 모델 하에서 그래프 통계 분석을 가능하게 하기 위해.
  • 모든 사용자가 자신의 데이터를 국소적으로 흐리게 처리해야 하는 민감한 간선을 가진 그래프에서 삼각형과 k-별과 같은 부분그래프 수를 추정하는 문제를 해결하기 위해.
  • 제한된 프라이버시 예산 하에서도 높은 유용성을 유지하는 효율적이고 실용적인 LDP 알고리즘을 개발하기 위해.
  • 삼각형과 k-별을 포함한 일반적인 그래프 통계에 대해 추정 오차의 이론적 하한을 설정하기 위해.
  • 제안된 알고리즘의 유용성을 다양한 프라이버시 예산 하에서 실세계 그래프 데이터셋에 대해 실증적으로 검증하기 위해.

제안 방법

  • 각 사용자가 서버에 전송하기 전에 무작위 응답 또는 라플라스 노이즈를 사용해 자신의 간선 정보를 독립적으로 흐리게 처리하는 국소 모델을 사용한다.
  • 사용자가 집계된 피드백에 기반해 자신의 응답을 조정할 수 있도록 허용함으로써 유용성을 향상시키기 위해 삼각형 수 추정을 위한 이중 라운드 상호작용 프로토콜을 제안한다.
  • 비상호작용 LDP 모델에서 k-별 수 추정의 순서 최적 오차를 달성하기 위해 라플라스 기반 메커니즘을 적용한다.
  • 서브그래프 수 추정 알고리즘의 노이즈 캘리브레이션을 위해 LDP를 사용해 최대 차수(d_max)를 비밀리에 추정하는 방법을 도입한다.
  • 정확성과 프라이버시의 균형을 위해 프라이버시 예산 ε를 d_max 추정과 서브그래프 수 추정 간에 할당하는 전략을 사용한다.
  • 실제 d_max를 사용하는 것과 비교해 최소한의 유용성 손실을 보이며, 추정된 d_max(∗_max)를 진짜 d_max의 대체 측정치로 사용함을 보여준다.

실험 결과

연구 질문

  • RQ1신뢰할 수 있는 중재자가 없이도 국소적 미분_privacy 모델 하에서 삼각형과 k-별과 같은 부분그래프 수를 정확하게 추정할 수 있는가?
  • RQ2상호작용(1라운드 대비 2라운드)은 국소적 프라이버시 하에서 부분그래프 수 추정의 오차에 어떤 영향을 미치는가?
  • RQ3LDP 하에서 일반적인 그래프 통계의 추정 오차에 대한 기본적인 한계(하한)는 무엇인가?
  • RQ4비상호작용 LDP 모델에서 k-별 수 추정에 대해 순서 최적 오차를 달성할 수 있는가?
  • RQ5최대 차수를 비밀리에 추정하는 것이 서브그래프 수 추정의 정확성에 어떤 영향을 미치는가?

주요 결과

  • 삼각형 수 추정을 위한 이중 라운드 프로토콜은 비상호작용 버전에 비해 추정 오차를 크게 감소시키며, LDP에서 상호작용의 이점을 입증한다.
  • k-별 수 추정에 대해 제안된 라플라스 기반 알고리즘은 비상호작용 LDP 모델에서 순서 최적의 추정 오차를 달성한다.
  • IMDB 데이터셋에서 ε=1일 때 삼각형 수 추정의 상대 오차가 0.30으로 매우 낮아, 중간 수준의 프라이버시 예산 하에서도 높은 유용성을 보인다.
  • IMDB에서 2-별 수 추정의 상대 오차가 ε=1일 때 0.0028로 매우 낮아, 고밀도 그래프에 대해 뛰어난 정확도를 보인다.
  • 비밀리에 추정한 d_max(∗_max)를 사용할 경우 진짜 d_max를 사용할 때와 유사한 상대 오차를 기록하며, 실용성의 타당성을 입증한다.
  • ε=2일 때 클러스터링 계수를 상대 오차 0.30로 추정할 수 있어, LDP 하에서도 의미 있는 그래프 분석의 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.