Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy Preserving Record Linkage via grams Projections

Luca Bonomi, Li Xiong|arXiv (Cornell University)|2012. 08. 14.
Privacy-Preserving Technologies in Data참고 문헌 21인용 수 8
한 줄 요약

이 논문은 개인 정보를 보호하는 레코드 연동 방법을 제안하며, 다양한 길이의 빈도 높은 그램을 이용한 비밀 보장된 데이터 임bedding을 통해 정확한 근사 매칭을 가능하게 한다. 개인 맞춤형 임계값을 사용하여, 미세 조정된 성능을 달성하고, 차별적 비밀 보장 기반으로 공식적인 개인정보 보호 보장을 확보한다. 이는 이전 연구 대비 확장성과 유용성에서 뛰어나며, 전역 임계값 히우리스틱이 필요 없음을 보여준다.

ABSTRACT

Record linkage has been extensively used in various data mining applications involving sharing data. While the amount of available data is growing, the concern of disclosing sensitive information poses the problem of utility vs privacy. In this paper, we study the problem of private record linkage via secure data transformations. In contrast to the existing techniques in this area, we propose a novel approach that provides strong privacy guarantees under the formal framework of differential privacy. We develop an embedding strategy based on frequent variable length grams mined in a private way from the original data. We also introduce personalized threshold for matching individual records in the embedded space which achieves better linkage accuracy than the existing global threshold approach. Compared with the state-of-the-art secure matching schema, our approach provides formal, provable privacy guarantees and achieves better scalability while providing comparable utility.

연구 동기 및 목표

  • 민감한 문자열 데이터에 대한 레코드 연동에서 유용성과 개인정보 보호의 균형을 맞추는 데 도전한다.
  • 차별적 비밀 보장 하에 공식적인 개인정보 보호 보장을 제공하는 안전한 변환 방법을 개발한다.
  • 각 레코드별로 개인 맞춤형 임계값을 도입하여 전역 임계값을 대체함으로써 연동 정확도를 향상시킨다.
  • 기존의 안전한 매칭 기법들(예: 리프시츠 임베딩)과 비교해 확장성과 유용성을 향상시킨다.
  • 최적의 임계값에 대한 사전 지식 없이도 근사 매칭을 가능하게 한다.

제안 방법

  • 원본 데이터로부터 다양한 길이의 빈도 높은 그램을 차별적 비밀 보장 알고리즘을 사용해 추출하여 비밀 기반을 형성한다.
  • 비밀 기반 그램을 사용해 문자열 레코드를 실수 벡터 공간에 임베딩하여 유사도를 유지함으로써 매칭을 가능하게 한다.
  • 개별 레코드의 개인정보 보호를 보장하기 위해 그램 추출 과정에 차별적 비밀 보장을 적용한다.
  • 로컬 데이터 특성에 기반한 개인 맞춤형 임계값을 도입하여 매칭 정확도를 향상시킨다.
  • 다양한 당사자로부터의 비밀 기반을 통합하여 공유된 임베딩 공간을 형성함으로써 안전한 연동을 실현한다.
  • 접두사 트리와 빈도 패턴 마이닝을 융합한 하이브리드 접근 방식을 사용해 효율적인 기반 구축을 수행한다.

실험 결과

연구 질문

  • RQ1빈도 높은 다양한 길이의 그램을 사용하여 문자열 레코드에 대해 비밀 보장 기반의 유용성 유지 임베딩을 구성할 수 있는가?
  • RQ2개인 맞춤형 임계값 설정이 전역 임계값 설정 대비 연동 정확도를 얼마나 향상시키는가?
  • RQ3레코드 연동을 위한 그램 추출 과정에 차별적 비밀 보장이 효과적으로 적용될 수 있으며, 유용성 유지가 가능한가?
  • RQ4기존의 안전한 변환 기법들과 비교해 제안된 방법이 데이터셋 크기가 증가함에 따라 어떻게 확장되는가?
  • RQ5제안된 프레임워크에서 개인정보 보호 수준(ε)과 연동 유용성 간의 상호 교환 관계는 어떠한가?

주요 결과

  • 제안된 방법은 비공개 기반의 그램 추출과 유사한 유용성을 달성하며, CITIES 데이터셋에서 정확한 매칭 시 F1 스코어가 0.92에 도달하고, 2편집 거리 매칭 시 0.60에 도달한다.
  • 개인 맞춤형 임계값 설정은 개별 레코드의 유사도에 맞게 적응함으로써 매칭 정확도를 크게 향상시키며, 최적의 임계값을 사전에 알 필요 없이도 가능하게 한다.
  • 실행 시간은 데이터셋 크기와 선형적으로 증가하여 뛰어난 확장성을 보이며, [23]의 리프시츠 기반 접근보다 약 50% 빠르게 동작한다.
  • 강력한 개인정보 보호(낮은 ε) 조건에서도 높은 유용성을 유지하여, 개인정보 보호와 유용성 간의 유리한 트레이드오프를 보여준다.
  • CITIES 데이터셋에서 기반 크기가 20를 초과할 경우 근사 최적의 유용성을 달성하는 반면, 리프시츠 임베딩은 작은 기반 크기(예: k=12)에서 최고의 성능을 보인다.
  • 접두사 트리와 FPM 마이너의 하이브리드 접근 방식은 비공개 기반의 그램 추출 방식의 유용성과 거의 동일하게 유지되며, 비밀 기반 그램 추출 전략의 효과성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.