Skip to main content
QUICK REVIEW

[論文レビュー] k-Nearest Neighbor Classification over Semantically Secure Encrypted Relational Data

Bharath K. Samanthula, Yousef Elmehdwi|arXiv (Cornell University)|Mar 19, 2014
Cryptography and Data Security被引用数 10
ひとこと要約

本論文は、クラウド環境における意味的に安全な暗号化されたリレーショナルデータに対して、プライバシーを守るk-最近傍(k-NN)分類器を提案する。この手法により、データ、クエリ、アクセスパターンを露呈せずに暗号化されたデータ上で安全に分類が可能であり、事前計算によりオンライン計算を33%高速化し、並列処理を用いることで最大6倍の高速化を達成する。クライアント側のオーバーヘッドは最小限に抑えられる。

ABSTRACT

Data Mining has wide applications in many areas such as banking, medicine, scientific research and among government agencies. Classification is one of the commonly used tasks in data mining applications. For the past decade, due to the rise of various privacy issues, many theoretical and practical solutions to the classification problem have been proposed under different security models. However, with the recent popularity of cloud computing, users now have the opportunity to outsource their data, in encrypted form, as well as the data mining tasks to the cloud. Since the data on the cloud is in encrypted form, existing privacy preserving classification techniques are not applicable. In this paper, we focus on solving the classification problem over encrypted data. In particular, we propose a secure k-NN classifier over encrypted data in the cloud. The proposed k-NN protocol protects the confidentiality of the data, user's input query, and data access patterns. To the best of our knowledge, our work is the first to develop a secure k-NN classifier over encrypted data under the semi-honest model. Also, we empirically analyze the efficiency of our solution through various experiments.

研究の動機と目的

  • 外部に委託されたクラウドデータベースにおける意味的に暗号化されたデータ上でk-NN分類を実行する課題に対処すること。
  • 暗号化された形で、データベースとユーザークエリの両方の機密性を保持すること。
  • クラウドおよびユーザーに対して、データのアクセスパターン(k-NN検索中にどのレコードがアクセスされたか)を隠ぺいし、推論攻撃を防ぐこと。
  • ユーザーに対しては、最終的なクラスラベルのみを公開し、中間結果の漏洩を防ぐこと。
  • 実世界のクラウド環境で実用可能であり、パフォーマンス最適化を考慮した効率的なプロトコルを設計すること。

提案手法

  • 属性ごとのデータおよびクエリレコードを意味的に安全な暗号化により保護することで、機密性を確保する。
  • 安全なマルチパーティ計算に基づくアプローチを導入し、機密データやアクセスパターンを露呈せずにk-NN距離を計算する。
  • ランダム化された暗号化と安全な比較プロトコルを用いて、復号せずに暗号化された距離を比較する。
  • 暗号化されたデータ上でk個の近い近傍を特定するため、安全な最小値計算(SMINn)プロトコルを採用する。
  • 0と1の暗号化を事前に計算することで、オンライン計算コストを33%削減する。
  • OpenMPを用いた並列処理により、ステージ1の計算を並列化し、6コアシステムで最大6倍の高速化を達成する。

実験結果

リサーチクエスチョン

  • RQ1意味的に暗号化されたリレーショナルデータ上で、クラウド環境で安全にk-NN分類を実行できるか?
  • RQ2分類処理中に、データベースおよびユーザークエリの機密性をどのように保持できるか?
  • RQ3k-NN検索中にアクセスされるレコードといった、データのアクセスパターンをクラウドおよびユーザーから隠ぺいできるか?
  • RQ4大規模データセットに対してスケーラブルな安全なk-NNを実現するためのパフォーマンス最適化は何か?
  • RQ5事前計算と並列処理は、実際の安全なk-NNの効率性にどのように影響を与えるか?

主な発見

  • 提案されたPP k-NNプロトコルは、事前計算を用いることで、ステージ1のオンライン計算コストを33.86%削減し、k=10、K=1024ビットの場合に127.72分から84.47分に短縮した。
  • OpenMPを用いた並列処理により、ステージ1の計算コストはk=25のとき127.72分から55.5分に低下し、6コアマシンで6倍の高速化を達成した。
  • プロトコルの総ネットワーク遅延は約2分(ステージ1で123.79秒)であり、これは総計算コストに比べて著しく小さいため、通信がボトルネックではないことが示された。
  • ボブによるクエリの暗号化に要する計算コストは、512〜1024ビット鍵の場合にそれぞれ4〜17ミリ秒であり、リソース制限のあるデバイスに対しても非常に効率的である。
  • プロトコルはデータアクセスパターンを効果的に隠ぺいし、ユーザーに対しては最終的なクラスラベルのみを公開するため、セミホンストモデル下でのすべてのプライバシー要件を満たしている。
  • 本プロトコルは、クラウド上で意味的に暗号化されたデータに対して、データ、クエリ、アクセスパターンを同時に保護する初の安全なk-NN分類手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。