[论文解读] Secure Data Processing in a Hybrid Cloud
本文提出了一种混合云架构,通过基于数据敏感性和工作负载将关系垂直划分到私有云和公共云之间,对敏感属性进行加密,并利用基于Hadoop和Hive的系统在加密和未加密数据上实现高效的查询处理。主要贡献是一个成本模型和查询处理引擎,可在保证安全性和性能的前提下最小化执行成本。
Cloud computing has made it possible for a user to be able to select a computing service precisely when needed. However, certain factors such as security of data and regulatory issues will impact a user's choice of using such a service. A solution to these problems is the use of a hybrid cloud that combines a user's local computing capabilities (for mission- or organization-critical tasks) with a public cloud (for less influential tasks). We foresee three challenges that must be overcome before the adoption of a hybrid cloud approach: 1) data design: How to partition relations in a hybrid cloud? The solution to this problem must account for the sensitivity of attributes in a relation as well as the workload of a user; 2) data security: How to protect a user's data in a public cloud with encryption while enabling query processing over this encrypted data? and 3) query processing: How to execute queries efficiently over both, encrypted and unencrypted data? This paper addresses these challenges and incorporates their solutions into an add-on tool for a Hadoop and Hive based cloud computing infrastructure.
研究动机与目标
- 解决混合云中安全数据处理的挑战,包括数据设计、数据安全和高效查询处理。
- 使用户能够将非关键工作负载外包给公共云,同时将关键任务数据和敏感属性保留在私有云中。
- 设计一个支持在分布式环境中对加密和未加密数据进行高效查询执行的系统。
- 通过优化公共云和私有云之间的数据分区和查询路由,最小化查询执行成本。
- 提供基于Hadoop HDFS和Hive的实际实现,支持在混合云存储上进行类似SQL的查询处理。
提出的方法
- 系统基于敏感性和工作负载,使用优化模型最小化查询成本,将关系垂直划分为公共云(A^pu)和私有云(A^pr)属性。
- 公共云中的敏感属性使用安全映射函数进行加密,而非敏感属性则以未加密形式存储。
- 提出一个成本模型,将执行成本估计为处理时间、通信成本和结果合并成本的加权和,权重结合了基础设施和网络特性。
- 将查询分解为公共子查询(q^pu)和私分子查询(q^pr),在并行执行后于私有云合并结果。
- 查询处理引擎使用HiveQL在基于Hadoop的存储上表达和执行子查询,支持基本SQL操作,并为加密数据提供属性映射支持。
- 通过重新排序操作符和应用选择下推优化,支持查询优化以减少中间结果大小。
实验结果
研究问题
- RQ1如何在公共云和私有云之间划分数据,以在安全性、性能和成本之间取得平衡?
- RQ2如何在公共云中使用加密安全地存储和处理敏感数据,同时支持高效的查询执行?
- RQ3如何在同时包含加密和未加密数据分区的混合云环境中高效执行查询?
- RQ4什么样的成本模型能够准确估算混合云环境中查询的端到端执行成本?
- RQ5当数据分布并加密时,系统如何保持查询正确性和性能?
主要发现
- 所提出的系统成功根据属性敏感性和工作负载对关系进行分区,减少了敏感数据在公共云中的暴露。
- 成本模型通过结合处理时间、通信成本和结果合并时间,有效估计了查询执行成本,权重已根据基础设施特性校准。
- 查询处理引擎通过将查询拆分为公共和私有组件并在并行执行中实现高效执行。
- 系统通过属性级加密和映射函数实现加密数据的安全处理,同时在云之间保持连接语义。
- 在Hadoop和Hive上的实现支持在混合云存储上进行类似SQL的查询处理,性能下降最小。
- 该算法的时间复杂度为O(k),其中k为子查询总长度,表明其与查询复杂度呈线性可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。