Skip to main content
QUICK REVIEW

[논문 리뷰] Private Rank Aggregation under Local Differential Privacy

Ziqi Yan, Gang Li|arXiv (Cornell University)|2019. 08. 13.
Privacy-Preserving Technologies in Data참고 문헌 46인용 수 4
한 줄 요약

이 논문은 비신뢰할 수 있는 캘린더가 존재하는 상황에서 개인의 상대적 선호 데이터를 보호하기 위해 랜덤라이즈드 리스폰스 또는 라플라스 노이즈를 개별 응답에 적용한 후 전송함으로써 국소적 차별적 비밀성(LOcal Differential Privacy, LDP)을 구현하는 랭킹 집계 프로토콜인 LDP-KwikSort를 제안한다. 이 방법은 수용 가능한 유틸리티를 유지하면서 강력한 프라이버시를 확보하며, 라플라스 기반 변형보다 우수하고 중심모델 기반 DP 성능에 가까워진다.

ABSTRACT

As a method for answer aggregation in crowdsourced data management, rank aggregation aims to combine different agents' answers or preferences over the given alternatives into an aggregate ranking which agrees the most with the preferences. However, since the aggregation procedure relies on a data curator, the privacy within the agents' preference data could be compromised when the curator is untrusted. Existing works that guarantee differential privacy in rank aggregation all assume that the data curator is trusted. In this paper, we formulate and address the problem of locally differentially private rank aggregation, in which the agents have no trust in the data curator. By leveraging the approximate rank aggregation algorithm KwikSort, the Randomized Response mechanism, and the Laplace mechanism, we propose an effective and efficient protocol LDP-KwikSort. Theoretical and empirical results show that the solution LDP-KwikSort:RR can achieve the acceptable trade-off between the utility of aggregate ranking and the privacy protection of agents' pairwise preferences.

연구 동기 및 목표

  • 비신뢰할 수 있는 데이터 캘린더가 존재할 때 랭킹 집계 과정에서의 프라이버시 보호 부족 문제를 해결하는 것 — 기존의 차별적 비밀성 기반 접근법에서 중요한 격차이자 핵심 과제이다.
  • 원천적으로 신뢰할 수 없는 캘린더가 존재하는 상황에서, 사용자가 원시 선호 데이터를 그대로 제공할 수 없는 국소적 차별적 비밀성 랭킹 집계(LDP-RA) 문제를 수립하고 해결하는 것.
  • 완전한 랭킹이 아닌 상대적 비교 데이터만을 보호하는 효율적인 프로토콜을 설계하여 프라이버시 泄露를 줄이고 유틸리티를 향상시키는 것.
  • 국소적 차별적 비밀성 모델에서 프라이버시 예산, 쿼리 수, 유틸리티 간의 트레이드오프를 평가하는 것.
  • 제안된 프로토콜이 강력한 프라이버시 보장을 받는 조건에서도 비프라이빗 기준 랭킹 품질에 근접한 집계 랭킹 품질을 유지할 수 있음을 입증하는 것.

제안 방법

  • 전체 랭킹이 아닌 상대적 비교 데이터를 기반으로 동작하는 KwikSort 알고리즘을 활용하여 집계 과정의 민감도를 감소시키는 것.
  • 사용자의 상대적 비교 응답을 전송하기 전에 랜덤라이즈드 리스폰스(RR) 또는 라플라스 메커니즘을 적용하여 노이즈를 첨가하는 로컬 랜덤라이저를 사용하는 것.
  • 캘린더의 후처리를 통해 노이즈가 첨가된 보고서로부터 집합적 상대적 비교 빈도를 추정하는 것.
  • 추정된 상대적 비교 빈도를 기반으로 KwikSort를 사용해 최종 집합적 랭킹을 구성하는 것.
  • 이론적 분석을 통해 집합적 상대적 프로파일 추정 오차의 상한선을 유도하여 최적의 쿼리 수 $K$ 선택을 안내하는 것.
  • 유틸리티와 프라이버시의 균형을 고려해 쿼리 수 $K$를 최적화하며, $m$개의 대안에 대해 $K = \sqrt{m}$ 근처에서 유틸리티가 최대에 이를 수 있음을 보여주는 것.

실험 결과

연구 질문

  • RQ1비신뢰할 수 있는 데이터 캘린더가 존재하는 상황에서 국소적 차별적 비밀성을 보장하는 랭킹 집계 프로토콜을 어떻게 설계할 수 있는가?
  • RQ2국소 모델에서 프라이버시를 유지하면서 유틸리티를 최대화하는 데 최적의 상대적 쿼리 수 $K$는 얼마인가?
  • RQ3LDP 랭킹 집계에서 랜덤라이즈드 리스폰스와 라플라스 메커니즘이 유틸리티 및 오차 측면에서 어떻게 비교되는가?
  • RQ4다양한 프라이버시 예산과 데이터 세트 특성 하에서 제안된 프로토콜이 집계 랭킹 정확도를 어느 정도 유지할 수 있는가?
  • RQ5Mallows 모델의 산산분포 파라미터 $\theta$ 는 LDP-KwikSort 프로토콜의 성능에 어떤 영향을 미치는가?

주요 결과

  • LDP-KwikSort:RR는 유틸리티 측면에서 항상 LDP-KwikSort:Lap을 앞서며, 평균 켄달 타우 거리와 오차율이 낮다.
  • 사용자 수 $n=2500$, 대안 수 $m=15$, $\theta=0.5$ 조건에서 LDP-KwikSort:RR와 LDP-KwikSort:Lap 간의 오차율 격차는 2.4%이며, $m=45$에 이르면 32.5%로 증가한다.
  • $n=5000$, $m=45$ 조건에서 $\theta$ 를 0.25에서 0.75로 증가시킬 경우, 평균 켄달 타우 거리 격차는 13.5%에서 46.5%로 증가한다.
  • $m \leq 15$ 인 경우 $\epsilon = 1.0$ 이면 수용 가능한 유틸리티를 확보할 수 있으나, $m$ 이 더 클 경우 성능을 유지하기 위해 $\epsilon = 3.0$ 을 권장한다.
  • 대안 수가 증가할수록 시간 소모가 증가하며, $m > 15$ 일 경우 LDP-KwikSort:RR는 더 높은 쿼리 수로 인해 LDP-KwikSort:Lap 보다 느려진다.
  • 프로토콜은 $\epsilon$-국소적 차별적 비밀성을 확보하며, 최적의 $K$ 설정 조건에서 중심모델 기반 DP-KwikSort와 유사한 유틸리티를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.