Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-Preserving Data Sharing for Genome-Wide Association Studies

Caroline Uhler, Aleksandra Slavković|arXiv (Cornell University)|May 3, 2012
Privacy-Preserving Technologies in Data参考文献 21被引用数 7
ひとこと要約

本稿は、個人のプライバシーを保護しながら、全ゲノム関連研究(GWAS)の集計データを差分プライバシーで公開する手法を提案している。主な対象は、最小アレル頻度(MAF)、カイ二乗統計量、p値などであり、特に遺伝子間相互作用を検出するための$\epsilon$-差分プライバシーを満たす正則化ロジスティック回帰アルゴリズムを導入。シミュレート済みおよび実際のイヌGWASデータにおいて、プライバシーと有用性のトレードオフが良好に達成されている。

ABSTRACT

Traditional statistical methods for confidentiality protection of statistical databases do not scale well to deal with GWAS (genome-wide association studies) databases especially in terms of guarantees regarding protection from linkage to external information. The more recent concept of differential privacy, introduced by the cryptographic community, is an approach which provides a rigorous definition of privacy with meaningful privacy guarantees in the presence of arbitrary external information, although the guarantees come at a serious price in terms of data utility. Building on such notions, we propose new methods to release aggregate GWAS data without compromising an individual's privacy. We present methods for releasing differentially private minor allele frequencies, chi-square statistics and p-values. We compare these approaches on simulated data and on a GWAS study of canine hair length involving 685 dogs. We also propose a privacy-preserving method for finding genome-wide associations based on a differentially-private approach to penalized logistic regression.

研究の動機と目的

  • 公的GWASデータベースにおけるプライバシーリスク、特に最小アレル頻度(MAF)データを狙った再識別攻撃(例:Homerらの手法)への脆弱性に対処する。
  • 外部情報が任意に利用可能な攻撃者に対しても意味のあるプライバシー保証を提供しない、従来の統計的漏洩防止手法の限界を克服する。
  • 差分プライバシーを用いた厳密なプライバシー保護フレームワークを構築し、MAF、カイ二乗統計量、p値などの集計GWAS統計量の安全な共有を可能にする。
  • エピスタシス(遺伝子間相互作用)を検出するための、差分プライバシーを拡張した複雑なGWAS解析に応用する。
  • 特にGWASで一般的に見られるスパースかつ中程度のサイズのデータセットを想定した現実的な条件下で、差分プライバシーを適用した要約統計量の統計的有用性を評価する。

提案手法

  • 最小アレル頻度(MAF)の公開に$\epsilon$-差分プライバシーを適用し、症例および対照群における最小アレルの度数に適切にスケーリングされたラプラスノイズを追加する。
  • カイ二乗統計量のための差分プライバシー手法を開発し、テスト統計量自体にノイズを直接追加することで、p値やセル度数にノイズを追加する手法よりも優れた有用性を示す。
  • Chaudhuriら(2011)のフレームワークを用い、正則化ロジスティック回帰の目的関数に、スケール$\frac{2}{\epsilon}$のラプラス分布から抽出されたノイズ項$b^T\beta$を追加する。
  • AIC/BICスコアに基づく前向き選択および後向き除外を、差分プライバシーを満たす最適化プロセスに統合し、関連するSNPおよび相互作用を同定する。
  • 個々の遺伝子型ベクトルの$\ell_2$-ノルムを$||x_i||_2 \leq K$で制限し、摂動された目的関数に対する感度解析を実施することでプライバシーを保証する。
  • プライバシー予算を$\epsilon' = \epsilon/2K$として割り当て、データ感受性に応じて正則化パラメータ$\delta$を調整することで、$\epsilon$-差分プライバシーを維持する。

実験結果

リサーチクエスチョン

  • RQ1集計GWAS統計量(MAF、$\chi^2$、p値)を差分プライバシーで公開することは、統計的有用性を損なわせることなく、強力なプライバシー保証を提供できるか?
  • RQ2カイ二乗統計量にノイズを追加する手法と、セル度数やp値にノイズを追加する手法を比較した場合、どちらが後続解析における有用性をよりよく維持できるか?
  • RQ3差分プライバシーは、エピスタシスを検出するための複雑なGWASモデル(例:正則化ロジスティック回帰)に効果的に拡張可能か?
  • RQ4データのスパarsityおよびサンプルサイズは、差分プライバシーを適用した要約統計量の有用性にどのような影響を及ぼすか?
  • RQ5二段階アプローチ(スクリーニング+相互作用検出)を差分プライバシーで実装した場合、遺伝子間相互作用の検出を可能にしつつ、プライバシーを維持できるか?

主な発見

  • カイ二乗統計量に直接ノイズを追加する手法が、セル度数が小さいもしくは中程度のテーブルにおいて、プライバシーと有用性のバランスが最も優れている。
  • 差分プライバシーを満たす正則化ロジスティック回帰アルゴリズムは、関連する遺伝的関連性や相互作用の検出能力を保持しつつ、$\epsilon$-差分プライバシーを達成している。
  • 685頭のイヌを対象としたGWASデータセットにおいて、提案手法はプライバシー保護された統計量を最小限の有用性損失で公開できており、標準的な関連解析に適している。
  • シミュレーションの結果、スパースデータでは単純な要約統計量では不十分であり、プライバシーと解析力の両方を維持するためには、より複雑で統合的なモデルが不可欠であることが示された。
  • ロジスティック回帰の目的関数にラプラスノイズを摂動することで、$\epsilon$-差分プライバシーが形式的に感度解析により保証されている。
  • 目的関数のノイズと正則化項のプライバシー予算を慎重に割り当てることで、AIC/BICを用いたモデル選択を支援しつつ、プライバシーを維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。