Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Secure Computation of Statistical Functions with Applications to k-Nearest Neighbors.

Hayim Shaul, Dan Feldman|arXiv (Cornell University)|Jan 22, 2018
Cryptography and Data Security参考文献 2被引用数 4
ひとこと要約

本論文は、FHEベースのKNN計算を実現する最初のスケーラブルなアルゴリズムを提示する。統計的コアセットと独自のコイントス技術を用いて、データセットサイズnに依存しない多項式時間での評価を可能にした。実験では、FHEを用いて1000点以上の点群から20個の最近傍を特定する処理を1時間未満で実行できた。

ABSTRACT

Given a set $S$ of $n$ $d$-dimensional points, the $k$-nearest neighbors (KNN) is the problem of quickly finding $k$ points in $S$ that are nearest to a query point $q$. The $k$-nearest neighbors problem has applications in machine learning for classification and regression and also in searching. The secure version of KNN where either $q$ or $S$ are encrypted, has applications such as providing services over sensitive (such as medical or localization) data. In this work we present the first scalable and efficient algorithm for solving KNN with Fully Homomorphic Encryption (FHE) that is realized by a polynomial whose degree is independent of $n$, the number of points. We implemented our algorithm in an open source library based on HELib implementation for the Brakerski-Gentry-Vakuntanthan's FHE scheme, and ran experiments on MIT's OpenStack cloud. Our experiments show that given a query point $q$, we can find the set of 20 nearest points out of more than 1000 points in less than an hour. Our result introduces a statistical coreset, which is a data summarization technique that allows statistical functions, such as moments, to be efficiently and scalably computed. As a central tool, we design a new coin toss technique which we use to build the coreset. This coin toss technique and computation of statistical functions may be of independent interest.

研究の動機と目的

  • 機密性の高い応用分野(医療データや位置情報など)を念頭に、暗号化されたデータ上でk-最近傍(KNN)の計算を安全に実行すること。
  • データポイント数nに依存しない計算時間で実現可能な、スケーラブルで効率的なFHEベースのKNNソリューションを設計すること。
  • FHE下で統計関数(モーメントなど)を効率的かつ安全に計算できるようにする統計的コアセット技術を導入すること。
  • FHE下での安全かつスケーラブルな統計的集約を可能にする、コアセット構築に特化した新規コイントス技術を開発すること。
  • 実際のクラウドインfraストラクチャ上での実装と評価を通じて、安全なKNNの実用的妥当性を示すこと。

提案手法

  • 大規模なデータセットを要約する統計的コアセットを提案し、FHE下でも統計関数を安全に計算できるようにすること。
  • コアセット構築中に安全で検証可能なランダム選択を可能にする新規コイントス技術を導入し、統計的正確性とプライバシー保護に不可欠な要素とする。
  • FHEを用いた距離計算と最近傍探索のための同型評価プロトコルを設計し、多項式の次数をnに依存させない形にすること。
  • HELlibライブラリを介してBrakerski-Gentry-Vakulchuk FHE方式を実装し、効率的な同型演算を実現すること。
  • MITのOpenStackクラウド上で、1000点以上のd次元点群を含むデータセットを対象に実験を実施し、性能を評価すること。
  • ブートストラップの回数を最小限に抑え、ノイズの増加を低減するようにFHEパイプラインを最適化し、大規模データに対する実用的な実行時間を達成すること。

実験結果

リサーチクエスチョン

  • RQ1FHEを用いた安全かつスケーラブルなKNNアルゴリズムを、データセットサイズに依存しない性能で構築可能か?
  • RQ2FHEを用いて暗号化されたデータ上で、モーメントのような統計関数を効率的に計算する方法は何か?
  • RQ3FHE下で安全かつ効率的なコアセット構築を可能にするために、どのような新規暗号的プリミティブが必要か?
  • RQ4実際のクラウドインfraストラクチャ上で、実用的なFHEベースのKNNシステムを実装・評価可能か?
  • RQ5現在のFHEライブラリを用いて、多数の点群に対する安全なKNN処理で達成可能な性能特性は何か?

主な発見

  • 提案されたFHEベースのKNNアルゴリズムは、1000点以上のd次元点群から20個の最近傍を特定する処理を、1時間未満で実行できた。
  • 統計的コアセットと効率的な同型評価の活用により、アルゴリズムの計算複雑度はデータポイント数nに依存しない。
  • 新規コイントス技術により、コアセット構築プロセス内での安全かつ効率的なランダムサンプリングが可能となり、統計的正確性に不可欠な要因となった。
  • HELlibとBrakerski-Gentry-Vakulchuk FHE方式を用いた実装は、実際のクラウドハードウェア上での安全なKNNの実用的妥当性を示した。
  • 統計的コアセットにより、FHE下でモーメントやその他の統計関数を効率的かつ安全に計算でき、より広範な応用への応用可能性を有する。
  • 結果から、FHEを用いた安全なKNNは、医療や位置情報などのプライバシーが重要な分野への実用的導入に十分にスケーラブルであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。