[论文解读] Sub-Linear Privacy-Preserving Near-Neighbor Search with Untrusted Server on Large-Scale Datasets
本文提出安全局部敏感索引(SLSI),这是首个次线性、隐私保护的近邻搜索协议,可在诚实但好奇的参与方之间实现对大规模数据集的高效、安全查询。该方法利用一种新颖的概率变换技术对局部敏感哈希进行处理,生成安全的二值嵌入,实现次线性查询时间与信息论隐私保障,已在真实世界数据上通过实证验证。
In Near-Neighbor Search (NNS), a new client queries a database (held by a server) for the most similar data (near-neighbors) given a certain similarity metric. The Privacy-Preserving variant (PP-NNS) requires that neither server nor the client shall learn information about the other party's data except what can be inferred from the outcome of NNS. The overwhelming growth in the size of current datasets and the lack of a truly secure server in the online world render the existing solutions impractical; either due to their high computational requirements or non-realistic assumptions which potentially compromise privacy. PP-NNS having query time {\it sub-linear} in the size of the database has been suggested as an open research direction by Li et al. (CCSW'15). In this paper, we provide the first such algorithm, called Secure Locality Sensitive Indexing (SLSI) which has a sub-linear query time and the ability to handle honest-but-curious parties. At the heart of our proposal lies a secure binary embedding scheme generated from a novel probabilistic transformation over locality sensitive hashing family. We provide information theoretic bound for the privacy guarantees and support our theoretical claims using substantial empirical evidence on real-world datasets.
研究动机与目标
- 解决现有PP-NNS方案在大规模真实场景下因计算成本过高或隐私假设不切实际而不可行的问题。
- 在PP-NNS中实现次线性查询时间,解决Li等人(CCSW'15)提出的长期悬而未决的开放问题,使系统可扩展至海量数据集。
- 在诚实但好奇威胁模型下,为客户端和服务器提供强隐私保障——信息论安全性。
- 基于一种新颖的概率变换技术,设计基于局部敏感哈希族的安全二值嵌入方案。
- 通过在真实世界数据集上的广泛实证评估,证明协议在效率与隐私方面的实用性。
提出的方法
- 提出一种新颖的概率变换方法,应用于局部敏感哈希(LSH)族,以生成保留相似性结构的安全二值嵌入。
- 利用这些嵌入构建安全索引,使服务器能够在不获知客户端数据的前提下执行高效、次线性的搜索。
- 集成密码学技术,确保客户端和服务器均无法获取除查询结果及其结果外的任何额外信息。
- 通过信息论分析,形式化界定隐私泄露的边界,确保仅查询结果被揭示。
- 设计一种安全计算协议,使客户端能够对二值嵌入使用加密或混淆查询向服务器发起查询。
- 优化索引结构,以支持快速的次线性查询时间,同时保持强隐私保障。
实验结果
研究问题
- RQ1能否在数据库规模下实现PP-NNS系统的次线性查询时间,同时保持强隐私保障?
- RQ2如何基于LSH族上的概率变换构建安全二值嵌入方案,以支持高效且私密的搜索?
- RQ3此类系统中可建立何种信息论隐私泄露边界?
- RQ4所提出的SLSI协议在真实世界大规模数据集上的实际可扩展性如何?
- RQ5该协议能否在诚实但好奇威胁模型下同时保持效率与强隐私?
主要发现
- SLSI在数据库规模下实现了次线性查询时间,使其适用于大规模数据集的可扩展性。
- 所提出的基于概率LSH变换的安全二值嵌入方案,支持高效且私密的索引构建。
- 建立了信息论隐私边界,证明仅NNS的结果被任一方知晓。
- 在真实世界数据集上的实证评估证实了协议的效率与实用性,展示了良好的可扩展性与低通信开销。
- 在诚实但好奇模型下,系统保持了强隐私,无超出查询结果的任何信息泄露。
- 与现有PP-NNS方案相比,SLSI在查询时间与隐私保障方面表现更优,尤其在大规模数据上优势显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。