Skip to main content
QUICK REVIEW

[论文解读] Data-Oblivious External-Memory Algorithms for the Compaction, Selection, and Sorting of Outsourced Data

Michael T. Goodrich|arXiv (Cornell University)|Mar 26, 2011
Cryptography and Data Security被引用 10
一句话总结

本文提出针对外包数据的、数据无关的外部内存算法,用于压缩、选择和排序,确保访问模式不泄露任何关于输入数据的信息。其 I/O 复杂度达到最优:压缩和选择为 $O(N/B)$,排序为高概率下的 $O((N/B)/log_{M/B}(N/B))$,采用新颖技术如洗牌-分发扰动和可逆布隆过滤器。

ABSTRACT

We present data-oblivious algorithms in the external-memory model for compaction, selection, and sorting. Motivation for such problems comes from clients who use outsourced data storage services and wish to mask their data access patterns. We show that compaction and selection can be done data-obliviously using $O(N/B)$ I/Os, and sorting can be done, with a high probability of success, using $O((N/B)\log_{M/B} (N/B))$ I/Os. Our methods use a number of new algorithmic techniques, including data-oblivious uses of invertible Bloom lookup tables, a butterfly-like compression network, randomized data thinning, and "shuffle-and-deal" data perturbation. In addition, since data-oblivious sorting is the bottleneck in the "inner loop" in existing oblivious RAM simulations, our sorting result improves the amortized time overhead to do oblivious RAM simulation by a logarithmic factor in the external-memory model.

研究动机与目标

  • 解决外包数据存储中的隐私泄露问题,即尽管已加密,访问模式仍可能泄露敏感信息。
  • 设计能够隐藏数据访问模式的算法,以在外部内存模型中保护用户隐私。
  • 在数据无关约束下,为基本操作——压缩、选择与排序——实现最优 I/O 复杂度。
  • 通过改进外部内存模型中的排序原 primitive,降低不经意 RAM 模拟的 I/O 开销,实现对数因子的优化。

提出的方法

  • 使用洗牌-分发数据扰动技术随机化访问模式,确保其与输入数据无关。
  • 采用可逆布隆查找表实现数据无关的压缩与选择,支持高效且私密的数据过滤。
  • 设计类似蝴蝶结构的压缩网络,递归减小子问题规模,同时保持数据无关性。
  • 应用随机化数据稀疏化技术,减少输入规模并管理排序中的子问题复杂度。
  • 基于概率子问题分析,采用故障清除技术,以高概率成功处理递归排序。
  • 结合填充排序与保持顺序的压缩技术,在保持数据无关性的同时重建最终排序输出。

实验结果

研究问题

  • RQ1在外部内存中,能否以数据无关的访问模式和最优的 $O(N/B)$ I/O 复杂度解决压缩与选择问题?
  • RQ2在标准外部内存假设下,能否实现 $O((N/B)/log_{M/B}(N/B))$ 的 I/O 复杂度,以实现数据无关的排序?
  • RQ3在递归算法中,如何在不通过访问模式或子问题规模泄露信息的情况下维持数据无关性?
  • RQ4能否通过改进外部内存模型中的排序原 primitive,降低不经意 RAM 模拟的 I/O 开销?
  • RQ5为确保递归子问题中数据无关排序的高概率成功,需要何种概率保障?

主要发现

  • 通过数据无关算法,压缩与选择可在 $O(N/B)$ I/O 内完成,与非私有版本的最优 I/O 边界一致。
  • 排序以高概率实现 $O((N/B)/log_{M/B}(N/B))$ I/O 复杂度,将不经意 RAM 模拟的摊销开销降低了一个对数因子。
  • 在宽块与高缓存假设下,该算法的成功概率为 $1 - 1/(N/B)^d$,其中 $d \geq 1$ 为任意常数。
  • 洗牌-分发与随机化数据稀疏化技术的使用,确保访问模式与输入数据值完全独立。
  • 故障清除技术可将失败的递归子问题数量降低至次多项式级别,且具有高概率,从而实现高效恢复。
  • 该框架支持在 Amazon S3 等外包存储系统中的实际部署,即使数据已加密,隐私保护访问也至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。