Skip to main content
QUICK REVIEW

[논문 리뷰] Secure Data Processing in a Hybrid Cloud

Vaibhav Khadilkar, Murat Kantarcıoğlu|arXiv (Cornell University)|2011. 05. 10.
Advanced Data Storage Technologies참고 문헌 17인용 수 7
한 줄 요약

이 논문은 데이터 민감도와 워크로드를 기반으로 관계를 수직적으로 분할하여 비공개 및 공개 클라우드 간에 데이터를 안전하게 처리하는 하이브리드 클라우드 아키텍처를 제안한다. 민감한 속성은 암호화되고, Hadoop 및 Hive 기반 시스템을 통해 암호화된 데이터와 암호화되지 않은 데이터 모두에서 효율적인 쿼리 처리를 가능하게 한다. 주요 기여는 실행 비용을 최소화하면서도 보안성과 성능을 유지하는 비용 모델과 쿼리 처리 엔진이다.

ABSTRACT

Cloud computing has made it possible for a user to be able to select a computing service precisely when needed. However, certain factors such as security of data and regulatory issues will impact a user's choice of using such a service. A solution to these problems is the use of a hybrid cloud that combines a user's local computing capabilities (for mission- or organization-critical tasks) with a public cloud (for less influential tasks). We foresee three challenges that must be overcome before the adoption of a hybrid cloud approach: 1) data design: How to partition relations in a hybrid cloud? The solution to this problem must account for the sensitivity of attributes in a relation as well as the workload of a user; 2) data security: How to protect a user's data in a public cloud with encryption while enabling query processing over this encrypted data? and 3) query processing: How to execute queries efficiently over both, encrypted and unencrypted data? This paper addresses these challenges and incorporates their solutions into an add-on tool for a Hadoop and Hive based cloud computing infrastructure.

연구 동기 및 목표

  • 하이브리드 클라우드에서의 안전한 데이터 처리 과제, 즉 데이터 설계, 데이터 보안, 효율적인 쿼리 처리를 해결하기 위해.
  • 비핵심 워크로드를 공개 클라우드로 외주함과 동시에 핵심 데이터와 민감한 속성을 비공개 클라우드에 유지할 수 있도록 하기 위해.
  • 분산 환경에서 암호화된 데이터와 암호화되지 않은 데이터 모두에 대해 효율적인 쿼리 실행을 지원하는 시스템을 설계하기 위해.
  • 공개 및 비공개 클라우드 간의 데이터 분할 및 쿼리 라우팅 최적화를 통해 쿼리 실행 비용을 최소화하기 위해.
  • Hadoop HDFS와 Hive를 사용한 실용적 구현을 제공하여 하이브리드 클라우드 스토리지에서 SQL 유사 쿼리 처리를 가능하게 하기 위해.

제안 방법

  • 민감도와 워크로드를 기반으로 관계를 공개 클라우드(A^pu) 및 비공개 클라우드(A^pr) 속성으로 수직 분할하고, 쿼리 비용을 최소화하기 위한 최적화 모델을 사용한다.
  • 공개 클라우드의 민감한 속성은 안전한 매핑 함수를 사용해 암호화되며, 비민감한 속성은 암호화되지 않은 채로 저장된다.
  • 실행 비용을 처리 시간, 통신 비용, 결과 조합 비용의 가중합으로 추정하는 비용 모델을 제안하며, 인프라 및 네트워크 특성에 대한 가중치를 포함한다.
  • 쿼리는 공개 쿼리(q^pu)와 비공개 쿼리(q^pr)로 분해되어 병렬로 실행되며, 결과는 비공개 클라우드에서 조합된다.
  • 쿼리 처리 엔진은 Hadoop 기반 스토리지에서 하이브QL을 사용해 하위 쿼리를 표현하고 실행하며, 기본 SQL 연산과 암호화된 데이터를 위한 속성 매핑을 지원한다.
  • 시스템은 연산자 재정렬 및 선택 조건 프로젝션 최적화를 통해 중간 결과 크기를 줄임으로써 쿼리 최적화를 지원한다.

실험 결과

연구 질문

  • RQ1보안, 성능, 비용을 균형 있게 유지하기 위해 데이터를 공개 및 비공개 클라우드 간에 어떻게 분할할 수 있는가?
  • RQ2암호화를 통해 공개 클라우드에서 민감한 데이터를 안전하게 저장하고 처리하면서도 효율적인 쿼리 실행을 어떻게 달성할 수 있는가?
  • RQ3암호화된 데이터 파artition과 암호화되지 않은 데이터 파artition이 모두 존재하는 하이브리드 클라우드에서 쿼리를 어떻게 효율적으로 실행할 수 있는가?
  • RQ4하이브리드 클라우드 환경에서 쿼리의 종단 간 실행 비용을 정확하게 추정할 수 있는 비용 모델은 무엇인가?
  • RQ5데이터가 분산되고 암호화된 상태일 때, 쿼리의 정확성과 성능을 어떻게 유지할 수 있는가?

주요 결과

  • 제안된 시스템은 속성의 민감도와 워크로드를 기반으로 관계를 성공적으로 분할하여 공개 클라우드에서 민감한 데이터 노출을 줄였다.
  • 처리 시간, 통신 비용, 결과 조합 비용을 가중합으로 조합하여 쿼리 실행 비용을 효과적으로 추정하는 비용 모델이 인프라 특성에 맞게 캘리브레이션되었다.
  • 쿼리를 공개 및 비공개 구성요소로 분할하고 병렬로 실행함으로써 쿼리 처리 엔진이 효율적인 실행을 달성했다.
  • 속성 수준의 암호화와 매핑 함수를 통해 암호화된 데이터의 안전한 처리를 지원하며, 클라우드 간 조인 의미를 유지한다.
  • Hadoop과 Hive 기반의 구현은 하이브리드 클라우드 스토리지에서 최소한의 성능 저하로 SQL 유사 쿼리 처리를 가능하게 했다.
  • 알고리즘은 쿼리의 하위 쿼리 총 길이 k에 대해 O(k) 시간 내에 실행되며, 쿼리 복잡도에 대해 선형 확장성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.