Skip to main content
QUICK REVIEW

[논문 리뷰] An Algorithmic Framework For Differentially Private Data Analysis on Trusted Processors

Joshua E. Allen, Bolin Ding|arXiv (Cornell University)|2018. 07. 02.
Privacy-Preserving Technologies in Data인용 수 10
한 줄 요약

이 논문은 Intel SGX와 같은 신뢰할 수 있는 프로세서를 활용하여 국소 모델의 강력한 프라이버시 보장과 글로벌 모델의 높은 정확도를 결합하는 새로운 프라이버시 프레임워크인 오블리비어스 디퍼렌셜 프라이버시(ODP)를 소개한다. 스트리밍 및 디퍼렌셜 프라이버시 기법을 활용해 무거운 헤비어스와 빈도 오라클에 대한 효율적인 오블리비어스 알고리즘을 제안하며, 국소 모델보다 훨씬 낮은 오차로 $(\epsilon, \delta)$-디퍼렌셜 프라이버시를 달성한다.

ABSTRACT

Differential privacy has emerged as the main definition for private data analysis and machine learning. The {\\em global} model of differential privacy, which assumes that users trust the data collector, provides strong privacy guarantees and introduces small errors in the output. In contrast, applications of differential privacy in commercial systems by Apple, Google, and Microsoft, use the {\\em local model}. Here, users do not trust the data collector, and hence randomize their data before sending it to the data collector. Unfortunately, local model is too strong for several important applications and hence is limited in its applicability. In this work, we propose a framework based on trusted processors and a new definition of differential privacy called {\\em Oblivious Differential Privacy}, which combines the best of both local and global models. The algorithms we design in this framework show interesting interplay of ideas from the streaming algorithms, oblivious algorithms, and differential privacy.

연구 동기 및 목표

  • 강력한 사용자 프라이버시 보장을 제공하지만 높은 오차율과 적용 범위 제한을 초래하는 국소 디퍼렌셜 프라이버시(LDP)의 한계를 해결하기 위해.
  • 데이터 수집자가 신뢰되지 않더라도 프라이버시를 보장할 수 있도록 신뢰할 수 있는 실행 환경(TEEs)을 활용하여 국소 모델과 글로벌 모델 간 격차를 메우기 위해.
  • 새로운 ODP 모델 하에서 무거운 헤비어스와 빈도 오라클과 같은 기본 문제를 해결하기 위한 효율적이고 오블리비어스인 알고리즘을 설계하기 위해.
  • LDP가 과도한 노이즈로 인해 실패하는 상황에서 ODP가 실용적이고 정확한 사생활 보호 데이터 분석을 가능하게 함을 보여주기 위해.

제안 방법

  • 신뢰할 수 있는 실행 환경(TEEs)을 활용하여 데이터 수집자가 신뢰되지 않더라도 프라이버시가 보장되는 새로운 정의인 오블리비어스 디퍼렌셜 프라이버시(ODP)를 제안한다.
  • 데이터에 독립적인 방식으로 데이터베이스를 처리하여 액세스 패턴이 정보를 泄露하지 않도록 보장하는 오블리비어스 알고리즘을 설계한다.
  • 이중 단계 접근 방식을 사용한다: 첫 번째로 스트리밍 방식으로 항목 유형과 빈도를 구성하고, 두 번째로 빈도에 라플라스 노이즈를 적용하며 결과를 오블리비어스하게 정렬한다.
  • 모든 데이터 액세스 패턴이 입력 데이터에 독립적이도록 오블리비어스 정렬과 프라이빗 메모리 액세스를 활용하여 디퍼렌셜 프라이버시를 유지한다.
  • 프라이빗 메모리에 Count-Min Sketch 데이터 구조를 유지하여 빈도 추정치를 관리하고, 이를 라플라스 노이즈와 함께 공개하여 쿼리에 응답한다.
  • 유니온 바운드와 尾確率 분석을 적용하여 희귀 항목이 泄露될 확률을 제한하며, 특정 조건 하에서 $(\epsilon, \frac{1}{m^{\tau-1}})$-ODP를 달성한다.

실험 결과

연구 질문

  • RQ1국소 모델의 강력한 프라이버시 보장과 글로벌 모델의 높은 정확도를 동시에 제공하는 사생활 보호 데이터 분석 프레임워크를 설계할 수 있는가?
  • RQ2신뢰할 수 있는 프로세서를 어떻게 활용하여 실용적이고 증명 가능한 프라이버시 보장을 갖춘 새로운 디퍼렌셜 프라이버시 정의를 가능하게 할 수 있는가?
  • RQ3이 새로운 모델 하에서 오블리비어스 알고리즘을 구성하여 무거운 헤비어스와 빈도 오라클과 같은 기본 문제를 해결할 수 있는가?
  • RQ4기존 모델과 비교해 새로운 ODP 프레임워크에서 프라이버시 파라미터와 오차 간의 상호 관계는 어떠한가?

주요 결과

  • 일반적인 응용에서 $k$ 가 상수일 경우 $n/k > \tau \log m$ 를 만족할 때, 제안된 ODP 프레임워크는 무거운 헤비어스 문제에 대해 $(\epsilon, \frac{1}{m^{\tau-1}})$-디퍼렌셜 프라이버시를 달성한다.
  • 모든 메모리 액세스가 입력 데이터에 독립적이며, 오블리비어스 정렬 네트워크를 사용해 $O(n \log n)$ 시간에 알고리즘이 실행된다.
  • 빈도 오라클 문제의 경우, 프라이빗 메모리에 Count-Min Sketch를 유지하고 라플라스 노이즈와 함께 공개함으로써 반복적 상호작용 없이도 정확하고 사생활 보호된 쿼리를 가능하게 한다.
  • 국소 디퍼렌셜 프라이버시(LDP) 대비 오차를 감소시킨다: LDP는 고유 요소 수세기에서 $\Omega(\sqrt{n})$ 오차를 보이지만, ODP는 $O(1/\epsilon)$ 오차를 가능하게 하여 글로벌 모델 성능에 가까워진다.
  • 원본 데이터베이스에 존재하지 않는 희귀 항목이 泄露될 확률은 $\frac{1}{m^{\tau-1}}$ 이하로 제한되며, $m$ 이 크고 $\tau > 1$ 일 경우 이는 무시할 수 있을 정도로 작다.
  • 디퍼렌셜 프라이버시 출력의 후처리(예: 상위-$k$ 항목 선택)는 ODP 보장을 유지하므로 종단 간 프라이버시를 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.