Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Private Record Linkage using Output Constrained Differential Privacy.

Xi He, Ashwin Machanavajjhala|arXiv (Cornell University)|2017. 02. 02.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 종단 간 프라이버시, 높은 리콜, 부분 이차 스케일러빌리티를 확보하는 엔드 투 엔드 프라이버시를 보장하는 새로운 프라이버시 모델인 출력 제약 디퍼렌셜 프라이버시(OCDP)를 제안한다. 일치하는 레코드를 정직하게 공개하면서도 디퍼렌셜 프라이버시 보장을 유지할 수 있도록 함으로써, 기존의 안전한 두 당사자 계산(S2PC) 기반 솔루션 대비 통신 및 계산 비용을 최대 100배 낮추고, 거의 선형 스케일링을 달성하는 프로토콜을 설계한다.

ABSTRACT

Private record linkage is the problem of identifying pairs of records that are similar as per an input matching rule from databases that are held by two parties that do not trust one another. We identify three key desiderata that a PRL solution must ensure: a proof of end-to-end privacy, communication and computational costs that scale sub-quadratically in the number of input records, perfect precision and high recall of matching pairs. We show that all of the existing solutions for PRL -- including secure 2-party computation (S2PC), and their variants that use non-private or differentially private (DP) blocking -- violate at least one of the three desiderata. In particular, S2PC techniques guarantee end-to-end privacy but have either low recall or high cost. We show that DP blocking based techniques do not provide an end-to-end privacy guarantee as DP does not permit the release of any exact answers (including matching records in PRL). In light of this deficiency, we propose a novel privacy model, called output constrained differential privacy, that shares the strong privacy protection of DP, but allows for the truthful release of the output of a certain function applied to the data. We apply this to PRL, and show that protocols satisfying this privacy model permit the disclosure of the true matching records, but their execution is insensitive to the presence or absence of a single non-matching record. We develop novel protocols that satisfy this end-to-end privacy guarantee and permit a tradeoff between recall, privacy and efficiency. Our empirical evaluations on real and synthetic datasets show that our protocols have high recall, scale near linearly in the size of the input databases (and the output set of matching pairs), and have communication and computational costs that are at least 2 orders of magnitude smaller than S2PC baselines.

연구 동기 및 목표

  • 종단 간 프라이버시, 부분 이차 스케일러빌리티, 높은 리콜을 동반한 완벽한 정밀도를 동시에 충족하지 못하는 기존 프라이빗 레코드 라이언킹(PRL) 솔루션의 한계를 해결하기 위해.
  • 기존 접근 방식—예를 들어 안전한 2자간 계산(S2PC) 및 디퍼렌셜 프라이버시(DP) 기반 블로킹—중 적어도 하나의 핵심 요구사항을 충족하지 못함을 규명하며, 특히 종단 간 프라이버시를 제공하지 못함을 밝힘.
  • 디퍼렌셜 프라이버시의 강력한 프라이버시 보장을 유지하면서도 PRL에서 일치하는 레코드 쌍을 정직하게 공개할 수 있도록 하는 새로운 프라이버시 모델을 개발하기 위해.
  • 이 새로운 모델 하에서 고성능 프로토콜을 설계하여 높은 리콜, 거의 선형 스케일링, 그리고 통신 및 계산 비용의 급격한 감소를 달성하기 위해.
  • 실제 및 합성 데이터셋을 대상으로 제안된 프로토콜을 실험적으로 검증하여, S2PC 기반 솔루션 대비 뛰어난 성능을 입증하기 위해.

제안 방법

  • 디퍼렌셜 프라이버시를 확장하여 정확한 출력(예: 일치하는 레코드 쌍)을 공개할 수 있도록 하되, 어떤 단일 일치하지 않는 레코드의 존재나 부재가 출력에 영향을 주지 않도록 보장하는 출력 제약 디퍼렌셜 프라이버시(OCDP)라는 프라이버시 모델을 도입한다.
  • 일치 여부를 판단하기 전에 데이터에 프라이버시 보존 변환을 적용하여 OCDP를 구현하는 프로토콜을 설계함으로써, 출력—특히 일치하는 레코드 쌍의 집합—는 정직하게 공개되지만 개별 일치하지 않는 레코드의 영향을 받지 않도록 보장한다.
  • OCDP를 통합한 블로킹 메커니즘을 사용하여 일치하는 레코드 쌍을 찾는 검색 공간을 줄여 효율성을 향상시키되, 리콜을 훼손하지 않는다.
  • 블로킹된 데이터만을 대상으로 작동하는 안전한 계산 레이어를 구현하여 통신 및 계산 비용을 최소화하면서도 종단 간 프라이버시를 유지한다.
  • 무엇보다도, 각 당사자가 최종 일치하는 레코드 집합 이외의 정보를 알 수 없도록 보장하기 위해 오블리비우스 의사난수 함수 및 안전한 집계 기법과 같은 암호학적 기법을 활용한다.
  • 중복된 계산 및 통신을 최소화하여 프로토콜 파이프라인을 최적화함으로써 입력 크기와 거의 선형적으로 확장되도록 한다.

실험 결과

연구 질문

  • RQ1디퍼렌셜 프라이버시의 강력한 보장을 유지하면서도 프라이빗 레코드 라이언킹에서 일치하는 레코드 쌍을 정직하게 공개할 수 있는 프라이버시 모델을 설계할 수 있는가?
  • RQ2S2PC나 DP 기반 블로킹을 사용하는 기존 PRL 솔루션은 종단 간 프라이버시, 부분 이차 스케일러빌리티, 높은 리콜과 완벽한 정밀도라는 세 가지 핵심 요구사항을 모두 충족하는가?
  • RQ3출력 제약 디퍼렌셜 프라이버시 하에서 새롭게 설계된 프로토콜이 S2PC 대비 통신 및 계산 비용을 수십 배에서 수백 배 감소시키면서도 고리콜을 유지할 수 있는가?
  • RQ4입력 데이터베이스 크기가 증가함에 따라 제안된 프로토콜은 어떻게 스케일링되며, 고리콜과 프라이버시 보장을 유지하는가?
  • RQ5실제 및 합성 데이터셋에서 제안된 프로토콜의 통신, 계산, 리콜 성능은 어떻게 평가되는가?

주요 결과

  • 제안된 프로토콜은 입력 데이터베이스 크기와 출력 집합 크기 양쪽에서 거의 선형 스케일링을 달성하여, S2PC의 이차 또는 그 이상의 스케일링 성능을 크게 향상시킨다.
  • S2PC 기반 솔루션 대비 통신 및 계산 비용이 최소 두 자리 수준 감소하여 뚜렷한 효율성 향상을 입증한다.
  • 일치하는 레코드 쌍을 노이즈를 추가하지 않고 정직하게 공개함으로써 높은 리콜—거의 완벽한 정밀도—를 유지한다.
  • 출력 제약 디퍼렌셜 프라이버시 모델은 종단 간 프라이버시를 성공적으로 유지하면서도 정확한 출력 공개를 가능하게 하여, 기존 DP 모델이 PRL에서 겪는 핵심 한계를 해결한다.
  • 실제 및 합성 데이터셋에 대한 실험적 평가를 통해 프로토콜이 효율적으로 확장되며, 성능 및 프라이버시 보장 측면에서 S2PC를 뛰어넘는 것으로 확인된다.
  • 이 방법은 프라이버시, 리콜, 효율성의 균형을 효과적으로 확보하여 대규모 프라이빗 레코드 라이언킹에 실용적인 솔루션을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.