[論文レビュー] Secure Data Processing in a Hybrid Cloud
本稿では、データの機密性とワークロードに基づいて関係を垂直に分割し、機密属性を暗号化することで、プライベートクラウドとパブリッククラウド間で安全にデータを処理するハイブリッドクラウドアーキテクチャを提案する。HadoopおよびHiveを基盤とするシステムを用いて、暗号化済みおよび未暗号化データの両方に対して効率的なクエリ処理を可能にする。主な貢献は、セキュリティとパフォーマンスを保持しつつ実行コストを最小化するコストモデルおよびクエリ処理エンジンである。
Cloud computing has made it possible for a user to be able to select a computing service precisely when needed. However, certain factors such as security of data and regulatory issues will impact a user's choice of using such a service. A solution to these problems is the use of a hybrid cloud that combines a user's local computing capabilities (for mission- or organization-critical tasks) with a public cloud (for less influential tasks). We foresee three challenges that must be overcome before the adoption of a hybrid cloud approach: 1) data design: How to partition relations in a hybrid cloud? The solution to this problem must account for the sensitivity of attributes in a relation as well as the workload of a user; 2) data security: How to protect a user's data in a public cloud with encryption while enabling query processing over this encrypted data? and 3) query processing: How to execute queries efficiently over both, encrypted and unencrypted data? This paper addresses these challenges and incorporates their solutions into an add-on tool for a Hadoop and Hive based cloud computing infrastructure.
研究の動機と目的
- ハイブリッドクラウドにおける安全なデータ処理の課題、すなわちデータ設計、データセキュリティ、および効率的なクエリ処理に対処すること。
- ユーザーが非重要なワークロードをパブリッククラウドにアウトソーシングできる一方で、ミッションクリティカルなデータおよび機密属性をプライベートクラウドに保持できることを実現すること。
- 分散環境において暗号化済みおよび未暗号化データの両方に対して効率的なクエリ実行をサポートするシステムを設計すること。
- パブリッククラウドとプライベートクラウド間のデータパーティショニングおよびクエリルーティングの最適化により、クエリ実行コストを最小化すること。
- Hadoop HDFSおよびHiveを用いた実用的な実装を提供し、ハイブリッドクラウドストレージ上でSQLに類似したクエリ処理を可能にすること。
提案手法
- 機密性とワークロードに基づいて、関係をパブリッククラウド(A^pu)およびプライベートクラウド(A^pr)の属性に垂直パーティショニングし、クエリコストを最小化する最適化モデルを用いる。
- パブリッククラウドに格納される機密属性は、安全なマッピング関数を用いて暗号化されるが、非機密属性は未暗号化のまま格納される。
- 処理時間、通信コスト、結果結合コストの加重和として実行コストを推定するコストモデルを提案し、インfra構成およびネットワーク特性に応じた重みを組み込む。
- クエリはパブリック(q^pu)およびプライベート(q^pr)のサブクエリに分解され、並列実行され、結果はプライベートクラウドで結合される。
- クエリ処理エンジンはHiveQLを用いてHadoopベースのストレージ上でサブクエリを表現・実行し、基本的なSQL操作および暗号化データの属性マッピングをサポートする。
- 演算子の再順序付けおよび選択条件プッシュダウンを適用することで、中間結果サイズを削減し、クエリ最適化を実現する。
実験結果
リサーチクエスチョン
- RQ1セキュリティ、パフォーマンス、コストのバランスを考慮して、データをパブリッククラウドとプライベートクラウドの間でどのようにパーティショニングすべきか。
- RQ2機密データをパブリッククラウドに安全に格納・処理するには、暗号化を用いるが、効率的なクエリ実行をどのように実現すべきか。
- RQ3暗号化済みおよび未暗号化データパーティションを含むハイブリッドクラウドにおいて、クエリをどのように効率的に実行すべきか。
- RQ4ハイブリッドクラウド環境におけるクエリのエンドツーエンド実行コストを正確に推定できるコストモデルは何か。
- RQ5データが分散され、暗号化されている状況でも、クエリの正しさとパフォーマンスをどのように維持できるか。
主な発見
- 提案されたシステムは、属性の機密性とワークロードに基づいて関係を適切にパーティショニングし、パブリッククラウドにおける機密データの露出を低減した。
- コストモデルは、処理時間、通信コスト、結果結合時間の加重和として実行コストを効果的に推定し、インfra構成特性に合わせた重みを調整することで、正確な推定を可能にした。
- クエリをパブリックおよびプライベートコンponentsに分割し、並列実行することで、クエリ処理エンジンが効率的な実行を達成した。
- 属性レベルの暗号化およびマッピング関数を用いることで、クラウド間でジョインの意味論を保持する安全な処理が実現された。
- HadoopおよびHive上での実装により、ハイブリッドクラウドストレージ上で最小限のパフォーマンス低下でSQLに類似したクエリ処理が可能になった。
- アルゴリズムは、kがサブクエリの総長さであるときO(k)の時間で実行され、クエリの複雑さに比例した線形スケーラビリティを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。