[论文解读] EsPRESSo: Efficient Privacy-Preserving Evaluation of Sample Set Similarity
该论文提出 EsPRESSo,一种新颖的密码协议,可高效且私密地计算或近似计算两方私有样本集之间的 Jaccard 相似度。通过利用 MinHash 技术和私有集合交集基数(PSI-CA),EsPRESSo 实现了安全、低复杂度的集合相似度评估,同时保护隐私并实现大小隐藏特性,其效率显著优于先前方法。
Electronic information is increasingly often shared among entities without complete mutual trust. To address related security and privacy issues, a few cryptographic techniques have emerged that support privacy-preserving information sharing and retrieval. One interesting open problem in this context involves two parties that need to assess the similarity of their datasets, but are reluctant to disclose their actual content. This paper presents an efficient and provably-secure construction supporting the privacy-preserving evaluation of sample set similarity, where similarity is measured as the Jaccard index. We present two protocols: the first securely computes the (Jaccard) similarity of two sets, and the second approximates it, using MinHash techniques, with lower complexities. We show that our novel protocols are attractive in many compelling applications, including document/multimedia similarity, biometric authentication, and genetic tests. In the process, we demonstrate that our constructions are appreciably more efficient than prior work.
研究动机与目标
- 解决在不披露实际内容的前提下,双方私有数据集之间私有相似度评估的挑战。
- 设计一种可证明安全且高效的协议,使用密码原语计算精确的 Jaccard 相似度指数。
- 开发一种近似协议,通过使用 MinHash 压缩输入集合以降低计算和通信开销。
- 实现大小隐藏,确保在协议执行过程中不泄露输入集合的大小。
- 实现在文档相似度、生物特征匹配和基因组检测等隐私敏感应用中的实际部署。
提出的方法
- 该协议以私有集合交集基数(PSI-CA)作为核心密码原语,安全计算两个私有集合交集的大小。
- 对于精确相似度计算,Jaccard 指数由通过 PSI-CA 获得的私有交集和并集基数推导得出。
- 为提高效率,协议对每个输入集合应用多哈希 MinHash,将其压缩为大小为 $k$ 的固定大小摘要,同时保留原始集合的统计特性。
- 近似协议通过 PSI-CA 计算 MinHash 摘要的交集,然后将 Jaccard 指数估计为 $\delta \cdot (v + w)/(1 + \delta)$,其中 $\delta$ 为摘要交集的大小。
- 协议通过将 $k$ 作为与实际输入集合大小无关的公开参数,确保大小隐藏,防止集合基数的泄露。
- 安全模型保证除相似度度量或集合大小(在精确情况下)外,不泄露任何关于私有集合的信息。
实验结果
研究问题
- RQ1双方互不信任时,如何安全计算其私有样本集之间的 Jaccard 相似度,而无需泄露任何私有数据?
- RQ2在保持可证明安全性和有界准确性的前提下,能否显著提升私有相似度评估的效率?
- RQ3MinHash 技术在安全计算协议中可多大程度上被集成,以降低通信和计算成本?
- RQ4在相似度评估背景下,特别是针对集合操作,能否实现大小隐藏,以防止输入集合基数的泄露?
- RQ5在隐私保护的相似度评估中,使用近似技术的实际影响和性能权衡是什么?
主要发现
- 所提出的协议在精确和近似相似度评估中均实现了可证明安全,确保除预期输出外不泄露任何私有数据。
- 使用 MinHash 将输入大小减少到常数 $k$,实现线性时间复杂度 $O(k)$,显著优于处理完整集合的效率。
- 近似协议引入了有界误差 $O(1/\sqrt{k})$,这对许多需要高效率的实际应用而言是可以接受的。
- 协议实现了大小隐藏,即任一方均无法获知对方输入集合的大小,这是先前 PSI-CA 协议通常无法提供的关键隐私属性。
- 该协议具有通用性,可应用于文档相似度、生物特征认证、多媒体文件比较和基因组数据分析等多种领域。
- 尽管论文未提供实验评估,但作者认为由于输入大小从 $|A|$ 和 $|B|$ 降低到 $k$,性能提升显著;且协议本质上与现有 PSI-CA 协议相同,但输入小得多。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。