[论文解读] IHOP: Improved Statistical Query Recovery against Searchable Symmetric Encryption through Quadratic Optimization
IHOP 是一种针对可搜索对称加密(SSE)的新颖统计查询恢复攻击,将查询恢复建模为通过线性分配子问题迭代求解的二次优化问题。它通过结合数据量、频率和共现信息,优于所有先前基于统计的攻击方法,在完整泄露设置下实现接近完美的准确率(高达99%),并在访问模式混淆和仅频率泄露且存在查询相关性的情况下显著优于现有方法。
Effective query recovery attacks against Searchable Symmetric Encryption (SSE) schemes typically rely on auxiliary ground-truth information about the queries or dataset. Query recovery is also possible under the weaker statistical auxiliary information assumption, although statistical-based attacks achieve lower accuracy and are not considered a serious threat. In this work we present IHOP, a statistical-based query recovery attack that formulates query recovery as a quadratic optimization problem and reaches a solution by iterating over linear assignment problems. We perform an extensive evaluation with five real datasets, and show that IHOP outperforms all other statistical-based query recovery attacks under different parameter and leakage configurations, including the case where the client uses some access-pattern obfuscation defenses. In some cases, our attack achieves almost perfect query recovery accuracy. Finally, we use IHOP in a frequency-only leakage setting where the client's queries are correlated, and show that our attack can exploit query dependencies even when PANCAKE, a recent frequency-hiding defense by Grubbs et al., is applied. Our findings indicate that statistical query recovery attacks pose a severe threat to privacy-preserving SSE schemes.
研究动机与目标
- 开发一种更有效的基于统计的SSE方案查询恢复攻击,且不依赖真实标签知识。
- 解决先前基于统计的攻击方法无法同时利用数据量共现或频率共现项的局限性。
- 在包括访问模式混淆和仅频率泄露在内的现实泄露配置下,评估IHOP的有效性。
- 探究近期防御机制(如pancake)在存在查询相关性时是否仍易受统计查询恢复攻击影响。
提出的方法
- IHOP将查询恢复建模为基于最大似然的二次优化问题,整合了数据量、频率和共现项。
- 它采用一种迭代启发式方法,通过求解一系列线性分配问题来近似查询与关键词之间的最优匹配。
- 该方法利用高效的最优线性求解器,可扩展至大规模关键词集合,实现比GraphM中使用的PATH等先前二次求解器更快的收敛速度。
- 它结合了数据量泄露(两个查询共享的文档数量)和频率泄露(查询频率)以提升恢复准确率。
- 通过将客户端行为建模为马尔可夫过程,该方法对查询依赖关系进行适配,从而能够推断相关查询模式。
- 该方法在五组真实世界数据集上,针对不同泄露配置进行了评估,包括完整访问模式泄露和应用pancake混淆后的仅频率泄露。
实验结果
研究问题
- RQ1通过联合建模数据量和频率共现,基于统计的查询恢复攻击是否能实现高于现有方法的准确率?
- RQ2在Gentry等人和Grubbs等人提出的访问模式混淆防御下,IHOP的表现如何?
- RQ3在缺乏数据量泄露的情况下,IHOP能否有效利用查询相关性,特别是在应用pancake防御时?
- RQ4当客户端查询存在相关性时,pancake频率平滑防御是否能为统计查询恢复提供充分保护?
- RQ5随着关键词集合规模和查询数量的增加,IHOP的性能如何扩展?
主要发现
- 在Lucene数据集(1,000个关键词)的完整访问模式泄露设置下,IHOP实现了约99%的查询恢复准确率,显著优于GraphM(仅56%准确率)。
- 在相同数据集上,IHOP耗时15分钟,而GraphM耗时近三天,表明其速度提升超过100倍。
- 在部分访问模式泄露设置下,IHOP在Lucene数据集上实现92%的准确率,远超此前最佳水平的7%,且耗时12分钟,而此前方法耗时超过5小时。
- 在仅频率泄露且存在查询依赖关系的条件下,IHOP在低质量辅助信息下实现48%准确率,在高质量信息下实现69%准确率,表明其能有效利用相关性。
- 在应用pancake防御时,IHOP将平均攻击准确率从无防御时的93.6%降至低质量辅助信息下的41.9%,从99.7%降至高质量信息下的60.5%,表明pancake对相关查询并非完全有效。
- 结果表明,当存在查询相关性时,pancake无法提供充分保护,与早期研究结论相矛盾,凸显了在该类条件下需要更强的防御机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。