[논문 리뷰] Sub-linear Privacy-preserving Search with Untrusted Server and Semi-honest Parties.
이 논문은 Locality Sensitive Hashing (LSH)에서 유래한 새로운 보안 확률적 임bedding를 사용하여, 반신뢰성 당사자와 신뢰할 수 없는 서버를 지원하는 최초의 하위선형, 개인정보 보호형 근접 이웃 검색(PP-NNS) 프로토콜을 제안한다. 이 방법은 쌍별 거리 泄露를 방지함으로써 삼각측량 공격에 저항하여, 거대한 데이터셋에서 효율적이고 확장 가능한 검색을 가능하게 하며, 강력한 신뢰 가정 없이도 개인정보를 유지한다.
Privacy-preserving Near-neighbor search (PP-NNS) is a well-studied problem in the literature. The overwhelming growth in the size of current datasets and the lack of any truly secure server in the online world render the existing solutions impractical either due to their high computational requirements or the non-realistic assumptions which potentially compromise privacy. PP-NNS with multiple (semi-honest) data owners having query time sub-linear in the number of users has been proposed as an open research direction. In this paper, we provide the first such algorithm which has a sub-linear query time and the ability to handle semi-honest (honest but curious) parties. Our algorithm can further manage the situation where a large chunk of the server information is being compromised. Probabilistic embedding based on Locality Sensitive Hashing (LSH) is the algorithm of choice for sub-linear near-neighbor search in high dimensions. However, we show that LSH is not suitable for semi-honest setting, and particularly when the server information is compromisable. LSH allows estimation of any pairwise distances between users, which can be easily compromised to learn user attributes using the idea of triangulation. We suggest a novel methodology which overcomes this LSH vulnerability. At the heart of our proposal lies a secure probabilistic embedding scheme generated from a novel probabilistic transformation over appropriate LSH family. Our secure embeddings combined with advances in multi-party computation result in an efficient PP-NNS algorithm suitable for massive-scale datasets without strong assumptions on the behavior of parties involved. We demonstrate the validity of our claims by experimentally showing the effectiveness of our solution in hiding the sensitive variables in medical records without compromising the precision-recall of the retrieval.
연구 동기 및 목표
- 실세계 환경에서 높은 계산 비용이나 비현실적인 신뢰 가정으로 인해 기존의 PP-NNS 솔루션이 비실용적이라는 점을 해결하기 위해.
- 반신뢰성(진실하지만 호기심 많은) 참여자들이 있는 다자간 환경에서 PP-NNS의 쿼리 시간을 데이터 소유자 수에 대해 하위선형으로 보장하기 위해.
- 서버가 해킹되었을 경우, 특히 서버 데이터의 대부분이 노출될 수 있는 상황에서의 개인정보 위험을 완화하기 위해.
- 표준 LSH가 쌍별 거리 추정을 통해 민감한 속성을 유추하는 삼각측량 공격에 취약한 점을 극복하기 위해.
- 의료 기록과 같이 거대 규모의 데이터셋에 적합한, 효율성과 정밀도를 모두 유지하는 보안적이고 확장 가능한 PP-NNS 시스템을 설계하기 위해.
제안 방법
- 적절한 LSH 가족 위에서 새로운 확률적 변환을 제안하여, 쌍별 거리를 은폐하는 보안적이고 개인정보 보호형 임bedding를 생성하기 위해.
- 다자간 계산(MPC)의 최신 기술을 통합하여, 민감한 데이터를 드러내지 않은 채로 개인 정보 보호형 쿼리 처리를 가능하게 하기 위해.
- 적대자가 사용자 간의 거리를 추정할 수 없도록 하는 보안 임bedding 체계를 설계하여, 삼각측량 기반의 속성 유추를 차단하기 위해.
- 변환된 LSH 임bedding의 확률적 구조를 활용하여, 사용자 수에 대해 쿼리 시간이 하위선형으로 유지되도록 하기 위해.
- 임bedding의 유용성을 유지하면서도 표준 LSH에 내재된 泄露 경로를 제거하는 개인정보 보호형 변환을 사용하기 위해.
- 보안 임bedding 메커니즘을 MPC 프로토콜과 결합하여 암호화되거나 가림 처리된 데이터에서의 개인 정보 보존 계산을 가능하게 하여, 반신뢰성 당사자가 입력을 초월해 정보를 알 수 없도록 하기 위해.
실험 결과
연구 질문
- RQ1반신뢰성 당사자 가정과 신뢰할 수 없는 서버 모델 하에서, 쿼리 시간이 하위선형인 PP-NNS 프로토콜을 설계할 수 있는가?
- RQ2쌍별 거리 추정을 통해 민감한 속성을 유추하는 삼각측량 공격에 대해 표준 LSH 기반 임bedding를 보호할 수 있는가?
- RQ3검색 유용성을 유지하면서도 쌍별 거리 泄露를 방지하는 LSH 가족에서 보안 임bedding 체계를 어떻게 구성할 수 있는가?
- RQ4제안된 방법이 거대한 데이터셋에 대해 얼마나 확장 가능할 수 있으며, 근접 이웃 검색의 개인정보 보호성과 정밀도를 유지할 수 있는가?
- RQ5서버 데이터의 상당 부분이 해킹되었을 경우에도 시스템이 개인정보 보호를 유지하면서도 내구성이 확보되는가?
주요 결과
- 제안된 보안 임bedding 메커니즘이 적대자가 사용자 간의 쌍별 거리를 추정하는 것을 방지하여, 삼각측량 기반 개인정보 유출 공격을 무력화함을 입증했다.
- 시스템은 데이터 소유자 수에 대해 하위선형 쿼리 시간을 달성하여, 거대 규모의 데이터셋에서 효율적인 검색을 가능하게 했다.
- 의료 기록에서 민감한 속성을 보호하는 동안에도 근접 이웃 검색의 높은 정밀도와 재현율을 유지함을 확인했다.
- 보안 임bedding와 다자간 계산의 통합을 통해, 어떤 당사자에 대해서도 강력한 신뢰 가정이 필요 없이 개인정보 보존 계산을 수행할 수 있었다.
- 실험적 평가를 통해 솔루션이 의료 데이터셋의 민감한 변수를 효과적으로 숨기면서도 검색 성능을 떨어뜨리지 않았음을 확인했다.
- 서버 해킹에 대해 저항력이 있으며, 보안 변환 덕분에 서버 데이터가 노출되어도 사용자 수준의 정보가 泄露되지 않았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.