Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-Enhanced Methods for Comparing Compressed DNA Sequences

David Eppstein, Michael T. Goodrich|arXiv (Cornell University)|Jul 18, 2011
Cryptography and Data Security参考文献 31被引用数 11
ひとこと要約

本稿では、通信量が集合差のサイズに比例するように設計された、プライバシー強化型プロトコルを提案する。このプロトコルは、逆転可能ブールフィルタ(IBF)を用いて圧縮されたDNA配列の比較を可能にし、安全かつ効率的な集合差分の計算を実現する。クエリを発行する側に対して情報理論的プライバシーを保証し、データ所有者に対しては定量的プライバシーを提供する。差分が閾値を超える場合、99%の信頼度でデータ所有者の配列が隠蔽され続けることを保証する。

ABSTRACT

In this paper, we study methods for improving the efficiency and privacy of compressed DNA sequence comparison computations, under various querying scenarios. For instance, one scenario involves a querier, Bob, who wants to test if his DNA string, $Q$, is close to a DNA string, $Y$, owned by a data owner, Alice, but Bob does not want to reveal $Q$ to Alice and Alice is willing to reveal $Y$ to Bob \emph{only if} it is close to $Q$. We describe a privacy-enhanced method for comparing two compressed DNA sequences, which can be used to achieve the goals of such a scenario. Our method involves a reduction to set differencing, and we describe a privacy-enhanced protocol for set differencing that achieves absolute privacy for Bob (in the information theoretic sense), and a quantifiable degree of privacy protection for Alice. One of the important features of our protocols, which makes them ideally suited to privacy-enhanced DNA sequence comparison problems, is that the communication complexity of our solutions is proportional to a threshold that bounds the cardinality of the set differences that are of interest, rather than the cardinality of the sets involved (which correlates to the length of the DNA sequences). Moreover, in our protocols, the querier, Bob, can easily compute the set difference only if its cardinality is close to or below a specified threshold.

研究の動機と目的

  • 膨大なデータサイズと増大するプライバシー危険性を背景に、ゲノムデータのプライバシー保護型照会ニーズに対応する。
  • 疾患リスクや民族的背景などの機微な情報を露呈せずに、圧縮されたDNA配列の効率的比較を可能にする。
  • 全配列ではなく集合差に焦点を当てることで、プライバシー保護型ゲノム照査における通信および計算コストを低減する。
  • ゲノムデータ比較プロトコルにおいて、クエリ発行者に対して情報理論的プライバシー、データ所有者に対しては定量的プライバシーを提供する。
  • アルゴリズム的効率性、暗号技術、バイオインフォマティクスを統合し、スケーラブルで安全なゲノムデータ処理を実現する。

提案手法

  • 本手法は、ゲノム配列の圧縮表現を用いて、DNA配列比較を集合差分問題に還元する。
  • 対象となる2つのDNA配列間の対称差を表すために、逆転可能ブールフィルタ(IBF)を採用し、そのサイズは関心のある閾値の基数に比例する。
  • クエリ発行者は、差分をτまで検出できる確率が1−ε以上となるように、2kτ個のセルを持つIBFを構築する。ここでk = ⌈log(τ/ε)⌉ + 1 である。
  • データ所有者はIBFを用いてクエリに応答し、差分集合のみを公開することで、差分が閾値を超える場合に自身のデータを保護する。
  • プロトコルは、対称差が十分に小さい場合に限り、クエリ発行者がIBFから要素を復元できるように制限し、プライバシーを維持する。
  • 理論的分析では、コインコレクター問題の境界を用いて、復元成功確率を定量的に評価し、プライバシー保証のための99%信頼度を確保する。

実験結果

リサーチクエスチョン

  • RQ1通信量が配列長に依存しないように、圧縮されたDNA配列の比較に向けたプライバシー保護型プロトコルを設計可能か?
  • RQ2クエリ発行者に対して情報理論的プライバシーを達成すると同時に、データ所有者に対しては定量的プライバシーを提供するにはどうすればよいか?
  • RQ399%の信頼度でデータ所有者の配列の再構築を防ぐために、IBFに必要な最小のセル数とハッシュ関数の数は何か?
  • RQ4圧縮表現の差分が数百万に達するような、数十億塩基のゲノム配列に適用した場合、プロトコルはスケーラブルか?
  • RQ5プライバシーと整合性を保ちつつ、より複雑なゲノム計算をサポートするようにプロトコルを拡張可能か?

主な発見

  • τ = 100、ε = 1/100の場合、クエリ発行者は15のハッシュ関数と3000セルのIBFを使用すればよく、全配列法と比較してストレージおよび通信コストを顕著に削減できる。
  • τ = 100で同じIBF構成を用いる場合、差分数が3461を超えると、データ所有者は99%の信頼度でプライバシーを確保できる。
  • 通信コストはDNA配列の全長ではなく、許容可能な集合差の最大サイズτに比例するため、スケーラビリティが確保される。
  • 理論的分析により、クエリ発行者が成功して復元する確率が有界であり、差分が大きくなるに従って減少することが示され、強力なプライバシー保証が得られる。
  • 本プロトコルは、クエリ発行者に対して情報理論的プライバシー、データ所有者に対しては定量的プライバシーを提供するため、実世界のゲノムデータ応用に適している。
  • 高い信頼度のプライバシー保証であっても、必要なIBFサイズが小さいことから、本手法はゲノムスケールのデータに対して効率的かつ実用的であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。