Skip to main content
QUICK REVIEW

[論文レビュー] SMCQL: Secure Querying for Federated Databases

Johes Bater, Gregory Elliott|arXiv (Cornell University)|Jun 22, 2016
Cryptography and Data Security参考文献 31被引用数 5
ひとこと要約

本稿では、相互に信頼できない当事者から構成される分散データベースに対して、安全でプライバシー保護された照会を可能にするフレームワークである smcql を提案する。安全な多人数計算(SMC)を用いて、SQL 照会を SMC 原 primitive に翻訳し、高価な安全計算を最小限に抑える実行最適化を行うことで、研究者が感覚的データをデータ提供者やブローカーに露呈することなく、希少疾患患者の数え上げのような複雑な照会を評価できる。実際の医療データセットにおいて実用的な性能を達成している。

ABSTRACT

People and machines are collecting data at an unprecedented rate. Despite this newfound abundance of data, progress has been slow in sharing it for open science, business, and other data-intensive endeavors. Many such efforts are stymied by privacy concerns and regulatory compliance issues. For example, many hospitals are interested in pooling their medical records for research, but none may disclose arbitrary patient records to researchers or other healthcare providers. In this context we propose the Private Data Network (PDN), a federated database for querying over the collective data of mutually distrustful parties. In a PDN, each member database does not reveal its tuples to its peers nor to the query writer. Instead, the user submits a query to an honest broker that plans and coordinates its execution over multiple private databases using secure multiparty computation (SMC). Here, each database's query execution is oblivious, and its program counters and memory traces are agnostic to the inputs of others. We introduce a framework for executing PDN queries named SMCQL. This system translates SQL statements into SMC primitives to compute query results over the union of its source databases without revealing sensitive information about individual tuples to peer data providers or the honest broker. Only the honest broker and the querier receive the results of a PDN query. For fast, secure query evaluation, we explore a heuristics-driven optimizer that minimizes the PDN's use of secure computation and partitions its query evaluation into scalable slices.

研究の動機と目的

  • 相互に信頼できない当事者(例:病院)間で共同データ分析を可能にするが、データプライバシーを損なわないようにする課題に対処すること。
  • 研究者が分散されたプライベートデータベース上で標準的な SQL 照会を実行できるシステムを設計し、個々のタプルおよび中間結果の機密性を保持すること。
  • ヒューリスティクスおよび照会パーティショニングを用いて SMC 依存度を低減することで、安全計算のパフォーマンスオーバーヘッドを最小限に抑えること。
  • 比較演算やネストされた照会を含む任意の SQL 操作を、分散型でプライバシー保護された環境においても、安全かつ正しく実行できること。
  • 実世界のデータ共有シナリオ(例:臨床研究ネットワーク)に適用可能な実用的でオープンソースのフレームワークを構築すること。

提案手法

  • 誠実なブローカーが、データ提供者の生データにアクセスせずに、プライベートデータネットワーク(PDN)アーキテクチャ上で照会実行を調整する。
  • SQL 照会が安全な多人数計算(SMC)原 primitive に翻訳され、各当事者の計算が他の者の入力について無知であることを保証する。
  • ヒューリスティクス駆動の照問最適化ツールが、SMC 必要性を特定し、SMC 使用量を減らすために照問計画を再構成する。これには、データのパーティショニングおよび平文での演算子の部分的評価が含まれる。
  • SQL 用のセキュリティ型システムを採用し、データの機密性を追跡し、照問演算子全体でプライバシー特性を強制する。
  • 安全計算がデータ提供者のホスト上でローカルに実行され、信頼できる第三者や外部のクラウドサーバーに依存しない。
  • 既存の SMC ベース技術を用いて、データベース間で共有される識別子(例:患者 ID)の安全なレコードリンクをサポートする。

実験結果

リサーチクエスチョン

  • RQ1相互に信頼できない当事者から構成される分散データベースに対して、生データを露呈せずに安全でプライバシー保護された照問を可能にするにはどうすればよいか?
  • RQ2安全な多人数計算のパフォーマンスオーバーヘッドを、データベース照問実行において最小限に抑えるにはどのような技術が有効か?
  • RQ3比較演算、集計、ネストされた照問を含む複雑な SQL 操作を、プライバシー保護フレームワーク内でどのように実行できるか?
  • RQ4研究者が標準 SQL を使用できるようにしつつ、データ提供者やブローカーが安全計算の平文出力を学習しないようにするシステムを設計できるか?
  • RQ5分散照問処理において正しさと安全性を維持しつつ、SMC 使用量を低減するのに有効な最適化は何か?

主な発見

  • smcql は、プライバシーを保持しつつ正確な照問結果を得ることを可能にする、複雑な SQL 照問を安全計算計画に効果的に翻訳できた。
  • 実際の医療データセットにおいて実用的なパフォーマンスを達成しており、大規模な入力サイズにもかかわらず PDN 照問が合理的な時間で完了した。
  • データのパーティショニングとヒューリスティクス最適化を適用することで、高価な SMC 操作の使用が顕著に削減され、効率が向上した。
  • 本フレームワークは、(例:≤、≥ などの) 任意のタプル比較およびネストされた照問をサポートしており、先行研究に欠けていた機能を実現したが、中間情報の漏洩もなかった。
  • データ提供者および誠実なブローカーが、安全計算の平文出力を学習しないようにし、先行手法よりもプライバシー保護を強化した。
  • 著者らは smcql のオープンソースリリースを準備しており、臨床データネットワークと協力して、実世界での展開をテストしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。