Skip to main content
QUICK REVIEW

[논문 리뷰] PrivMin: Differentially Private MinHash for Jaccard Similarity Computation

Ziqi Yan, Jiqiang Liu|arXiv (Cornell University)|2017. 05. 20.
Privacy-Preserving Technologies in Data참고 문헌 21인용 수 7
한 줄 요약

이 논문은 Jaccard 유사도 계산을 위한 차별적(private) MinHash 알고리즘인 PrivMin을 제안한다. 이 알고리즘은 엄격한 $ε$-차별적 비밀유지 보장과 함께 유용성도 유지한다. 새로운 두 가지 비밀유지 연산을 도입한다: MinHash 값 생성 과정에 지수적 소음을 주입하고, MinHash 단계 선택을 랜덤라이즈드 리스폰스 기반으로 수행한다. 이로 인해 실제 데이터셋에서 최소한의 유용성 손실로 강력한 비밀유지 보장을 달성한다.

ABSTRACT

In many industrial applications of big data, the Jaccard Similarity Computation has been widely used to measure the distance between two profiles or sets respectively owned by two users. Yet, one semi-honest user with unpredictable knowledge may also deduce the private or sensitive information (e.g., the existence of a single element in the original sets) of the other user via the shared similarity. In this paper, we aim at solving the privacy issues in Jaccard similarity computation with strict differential privacy guarantees. To achieve this, we first define the Conditional $ε$-DPSO, a relaxed differential privacy definition regarding set operations, and prove that the MinHash-based Jaccard Similarity Computation (MH-JSC) satisfies this definition. Then for achieving strict differential privacy in MH-JSC, we propose the PrivMin algorithm, which consists of two private operations: 1) the Private MinHash Value Generation that works by introducing the Exponential noise to the generation of MinHash signature. 2) the Randomized MinHashing Steps Selection that works by adopting Randomized Response technique to privately select several steps within the MinHashing phase that are deployed with the Exponential mechanism. Experiments on real datasets demonstrate that the proposed PrivMin algorithm can successfully retain the utility of the computed similarity while preserving privacy.

연구 동기 및 목표

  • 반드시 알고 있는 배경 지식을 가진 반신뢰성 있는 사용자가 비밀 집합 원소를 유추할 수 있는 MinHash 기반 Jaccard 유사도 계산에서의 비밀 유출 문제를 해결하기 위해.
  • 집합 연산에 적용 가능한 완화된 차별적 비밀유지 정의인 조건부 $ε$-DPSO를 수식화하기 위해.
  • 유사도 계산에서 높은 유용성을 유지하면서 실용적인 차별적 비밀유지 알고리즘(PrivMin)을 설계하기 위해.
  • 기본선비 방법에 비해 유용성의 심각한 저하 없이 강력한 비밀유지 보장을 달성하는지 확인하기 위해.

제안 방법

  • 집합 연산에 특화된 완화된 차별적 비밀유지 정의인 조건부 $ε$-DPSO를 도입하고, MH-JSC가 이를 만족함을 증명한다.
  • 지수 기반 메커니즘을 사용하여 MinHash 값 생성 과정에 직접 소음을 주입함으로써 비밀유지된 MinHash 값 생성을 제안한다.
  • 랜덤라이즈드 리스폰스 기법을 활용해 비밀스럽게 MinHash 단계 선택을 수행하는 랜덤라이즈드 MinHash 단계 선택을 구현한다.
  • 두 연산을 결합하여 Jaccard 유사도 파이프라인 전반에 걸쳐 엔드 투 엔드 $ε$-차별적 비밀유지를 보장하는 PrivMin 알고리즘을 구성한다.
  • 이중 단계 접근 방식을 사용한다: 첫 번째로 비밀스럽게 MinHash 서명을 생성하고, 두 번째로 최종 유사도 추정에 사용할 단계를 비밀스럽게 선택한다.
  • 최종 출력을 훼손하는 것보다는 계산의 가장 세밀한 수준에서 소음을 주입함으로써 유용성을 유지한다.

실험 결과

연구 질문

  • RQ1집합 연산에 적용 가능한 완화된 차별적 비밀유지 정의를 설정하여 MinHash 기반 Jaccard 유사도 계산의 비밀성을 분석할 수 있는가?
  • RQ2유용성에 영향을 주지 않으면서 MinHash 과정에서 차별적 비밀유지를 엄격히 보장할 수 있는가?
  • RQ3소음 배치 위치, 특히 MinHash 값 생성 단계에 소음을 주입하는 것이 비밀성과 유용성에 미치는 영향은 무엇인가?
  • RQ4유사도 계산 후 소음을 추가하는 기존의 차별적 비밀유지 방법에 비해 PrivMin은 어떻게 비교되는가?
  • RQ5실제로 비밀성과 유용성의 상호 균형을 최적화하는 데에 적합한 파라미터 설정(예: $\epsilon$, $K$)은 무엇인가?

주요 결과

  • PrivMin은 MinHash 값 생성에 지수 기반 메커니즘을 적용하고 단계 선택에 랜덤라이즈드 리스폰스를 사용함으로써 $ε$-차별적 비밀유지를 달성하며, 강력한 비밀유지 보장을 보장한다.
  • 모든 데이터셋과 파라미터 설정에서 PrivMin의 평균 제곱오차(MSE)는 기준선 및 MH-JSC보다 일관되게 낮으며, $\epsilon=1.0$, $K=25$일 때 Alpine Dale에서 MSE 값이 최소 0.000016까지 감소한다.
  • F1 점수의 경우, PrivMin은 $\epsilon$와 $K$가 변화하더라도 안정적인 성능을 유지하며, $\epsilon \leq 1.0$ 및 $K \leq 20$ 또는 $\epsilon \leq 0.85$ 및 $K \leq 25$일 경우 기준선을 능가한다.
  • 알고리즘은 $K$의 변화에 대해 강건하며, 유용성의 최소한의 저하를 보이며, MinHash 수준에서 소음을 주입하는 것이 유사도 계산 후 소음을 추가하는 것보다 더 효과적임을 시사한다.
  • PrivMin은 기준선에 비해 유용성 지표에서 뚜렷한 우수성을 보인다. 예를 들어, Alpine Dale에서 $\epsilon=0.01$일 때 MSE는 기준선의 801.6931에서 0.000055로 감소하여 약 14,576배의 향상이 이루어졌다.
  • 결과는 PrivMin이 강력한 비밀유지 예산($\epsilon \leq 1.0$) 조건에서도 수용 가능한 유용성을 유지함을 확인하며, 비밀유지가 중요한 응용 분야에서의 실질적 구현에 적합함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.