[論文レビュー] Privacy Preserving Record Linkage via grams Projections
本稿では、個人差に応じたしきい値を用いた安全なデータ埋め込みを可能にする、微分プライバシーに基づく頻度の高い可変長グラムを用いたプライバシー保護型レコードリンク手法を提案する。これにより、形式的なプライバシー保証のもとで正確な近似一致が実現可能となり、先行研究に比べスケーラビリティと有用性に優れ、グローバルなしきい値ヒューリスティクスの必要性が不要になる。
Record linkage has been extensively used in various data mining applications involving sharing data. While the amount of available data is growing, the concern of disclosing sensitive information poses the problem of utility vs privacy. In this paper, we study the problem of private record linkage via secure data transformations. In contrast to the existing techniques in this area, we propose a novel approach that provides strong privacy guarantees under the formal framework of differential privacy. We develop an embedding strategy based on frequent variable length grams mined in a private way from the original data. We also introduce personalized threshold for matching individual records in the embedded space which achieves better linkage accuracy than the existing global threshold approach. Compared with the state-of-the-art secure matching schema, our approach provides formal, provable privacy guarantees and achieves better scalability while providing comparable utility.
研究の動機と目的
- 機密性の高い文字列データにおけるレコードリンクにおいて、有用性とプライバシーのバランスを図る課題に取り組む。
- 微分プライバシーのもとで形式的なプライバシー保証を提供する、安全な変換手法を開発する。
- 各レコードごとに個別に最適化されたしきい値に置き換えることで、リンク精度を向上させる。
- 従来の安全なマッチング方式(例:リプシッツ埋め込み)と比較して、スケーラビリティと有用性を向上させる。
- 最適なしきい値の値を事前に知らない状態でも、近似マッチングを可能にする。
提案手法
- 微分プライバシーを適用したアルゴリズムを用いて、元のデータから頻度の高い可変長グラムを抽出し、プライベートベースを構築する。
- プライベートなグラムベースを用いて、文字列レコードを実数ベクトル空間に埋め込み、類似性を保持したままマッチングを可能にする。
- マイニングプロセスに微分プライバシーを適用することで、個々のレコードのプライバシーを保証する。
- ローカルなデータ特性に基づいて、各レコードに個別に最適化されたしきい値を導入し、マッチング精度を向上させる。
- 複数の参加者からのプライベートベースを統合して、共有埋め込み空間を構築し、安全なレコードリンクを実現する。
- 効率的なベース構築のため、プレフィックスツリーと頻度パターンマイニング(FPM)を組み合わせたハイブリッドアプローチを採用する。
実験結果
リサーチクエスチョン
- RQ1頻度の高い可変長グラムを用いて、プライベートかつ有用性を保つ文字列レコードの埋め込みを構築できるか?
- RQ2グローバルなしきい値と比較して、個別最適化しきい値がどのようにリンク精度を向上させるか?
- RQ3微分プライバシーをレコードリンクのためのグラムマイニングに効果的に適用できるか、かつ有用性を維持できるか?
- RQ4本手法は、既存の安全な変換技術と比較して、データセットサイズの増大に伴いどのようにスケーリングするか?
- RQ5本フレームワークにおけるプライバシー(ε)とリンク有用性のトレードオフはどのようなものか?
主な発見
- 非プライベートなマイニングと同等の有用性を達成しており、CITIESデータセットにおいて正確一致ではF1スコアが0.92、2編集距離一致では0.60に達する。
- 個別最適化しきい値により、個々のレコードの類似度に応じた適応が可能となり、最適なしきい値の事前知識が不要になる。
- 実行時間はデータセットサイズに比例して線形に増加し、強力なスケーラビリティを示しており、[23]におけるリプシッツベースのアプローチと比較して約50%速い。
- 強いプライバシー(低いε)でも高い有用性を維持でき、プライバシーと有用性の間で有利なトレードオフを実現している。
- CITIESデータセットにおいて、20以上のベースサイズで近似的に最適な有用性を達成するが、リプシッツ埋め込みは小さいベースサイズ(例:k=12)で最良の性能を示す。
- ハイブリッドなプレフィックスツリーとFPMマイナーのアプローチは、非プライベートマイニングの有用性をほぼ完全に再現しており、プライベートグラムマイニング戦略の有効性を裏付けている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。