Skip to main content
QUICK REVIEW

[論文レビュー] Overlook: Differentially Private Exploratory Visualization for Big Data

Pratiksha Thaker, Mihai Budiu|arXiv (Cornell University)|Jun 22, 2020
Privacy-Preserving Technologies in Data被引用数 8
ひとこと要約

Overlookは、擬似擬似乱数関数を用いて段階的にノイズを計算することで、大規模データに対するインタラクティブで微分プライバシー保護された探索的可視化を可能にする仮想サマリー機構を導入する。これにより、高コストの事前計算やストレージの必要がなくなり、従来のサマリーに基づくシステムと同等の精度を実現しながら、低レイテンシのクエリ性能とデータ管理者によるインタラクティブなプライバシー設定調整を提供する。

ABSTRACT

Data exploration systems that provide differential privacy must manage a privacy budget that measures the amount of privacy lost across multiple queries. One effective strategy to manage the privacy budget is to compute a one-time private synopsis of the data, to which users can make an unlimited number of queries. However, existing systems using synopses are built for offline use cases, where a set of queries is known ahead of time and the system carefully optimizes a synopsis for it. The synopses that these systems build are costly to compute and may also be costly to store. We introduce Overlook, a system that enables private data exploration at interactive latencies for both data analysts and data curators. The key idea in Overlook is a virtual synopsis that can be evaluated incrementally, without extra space storage or expensive precomputation. Overlook simply executes queries using an existing engine, such as a SQL DBMS, and adds noise to their results. Because Overlook's synopses do not require costly precomputation or storage, data curators can also use Overlook to explore the impact of privacy parameters interactively. Overlook offers a rich visual query interface based on the open source Hillview system. Overlook achieves accuracy comparable to existing synopsis-based systems, while offering better performance and removing the need for extra storage.

研究の動機と目的

  • 大規模データセットにおけるインタラクティブで探索的なデータ分析における微分プライバシー予算の管理という課題に対処すること。
  • プライベートデータ分析に用いられる従来のサマリーに基づくシステムにおける高い計算コストとストレージコストを排除すること。
  • データ管理者がプライバシーパラメータ(例:ε)をインタラクティブに調整し、その影響をリアルタイムで可視化できること。
  • 既存のSQLベースのクエリエンジンを変更せずに、プライバシー保護されたインタラクティブな可視化クエリをサポートすること。
  • 微分プライバシーを実世界のデータ探索ワークフローに実用的かつ使いやすくするために、なじみのある可視化インターフェースと統合すること。

提案手法

  • Overlookは、擬似乱数関数(PRF)を用いてノイズ分布を表現する仮想サマリーというデータ構造を用い、実際のサマリーデータの保存を回避する。
  • クエリごとに、階層的ヒストグラムメカニズムに基づきPRFを用いてノイズをオンデマンドで計算することで、微分プライバシーを保証する。
  • 既存のSQL DBMSエンジンとユーザーの間のインタポジションレイヤーとして機能し、下位のエンジンを変更せずにクエリ結果にノイズを注入する。
  • 多次元クエリでは、階層的パーティショニングを活用して、データの次元に応じてノイズを適応的に適用し、精度を向上させる。
  • 仮想サマリーにより、管理者がプライバシーパラメータ(例:ε)をインタラクティブに調整し、クエリ出力への影響を即座に観察できる。
  • オープンソースのHillviewシステムと統合し、データアナリスト向けに洗練されたプライバシー配慮型の可視化クエリインターフェースを提供する。

実験結果

リサーチクエスチョン

  • RQ1事前計算やストレージのオーバーヘッドなしに、インタラクティブで微分プライバシー保護された可視化を可能にする仮想サマリー機構を設計できるか?
  • RQ2データ管理者がプライバシーパラメータ(例:ε)の影響をリアルタイムでクエリ結果にどのように探索できるか?
  • RQ3仮想サマリーは、従来のサマリーに基づくシステムと同等の精度を達成しながら、低レイテンシのクエリパフォーマンスを維持できるか、その範囲はどの程度か?
  • RQ4既存のSQLベースの分析エンジンに最小限の変更で、プライバシー保護された可視化システムを構築できるか?
  • RQ5ノイズ生成に擬似乱数関数を用いることで、システムの精度とプライバシー保証にどのような影響が生じるか?

主な発見

  • Overlookは、PrivateSQLのような従来のサマリーに基づくシステムと同等の精度を達成し、パフォーマンス劣化は最小限に抑えられる。
  • クエリあたりの追加計算量はO(k)にとどまり、kは出力タプル数(例:ヒストограмのビン数)であるため、インタラクティブ利用に適している。
  • データ管理者はプライバシーパラメータ(例:ε)をインタラクティブに調整し、クエリ出力への即時の変化を観察でき、効果的なプライバシー予算管理が可能になる。
  • 仮想サマリーの設計により、高コストの事前計算と大容量のストレージ要件が不要となり、生データクエリと比較してオーバーヘッドはほぼゼロに近づく。
  • 可視化の縦ピクセル数のおよそ2.3倍の最大カウントにおいて、ε = 1では生データと区別がつかないプライバシー保護水準が達成される。
  • 既存のSQLエンジンおよびHillview可視化インターフェースとの統合により、実世界のデータ分析ワークフローへのシームレスな導入が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。