Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Clustering: Tight Approximation Ratios

Badih Ghazi, Ravi Kumar|arXiv (Cornell University)|Aug 18, 2020
Privacy-Preserving Technologies in Data参考文献 97被引用 11
一句话总结

本文提出了针对 $k$-means、$k$-median、$1$-Cluster 和 DensestBall 問題的差分私密聚類算法,其近似比幾乎達到最優——與最佳非私密算法一致——同時僅引入微小的加法誤差。該方法利用了一種新型的差分私密 ClosestPair 數據結構,支援高效更新,進而實現多項式時間內的緊密近似保證。

ABSTRACT

We study the task of differentially private clustering. For several basic clustering problems, including Euclidean DensestBall, 1-Cluster, k-means, and k-median, we give efficient differentially private algorithms that achieve essentially the same approximation ratios as those that can be obtained by any non-private algorithm, while incurring only small additive errors. This improves upon existing efficient algorithms that only achieve some large constant approximation factors. Our results also imply an improved algorithm for the Sample and Aggregate privacy framework. Furthermore, we show that one of the tools used in our 1-Cluster algorithm can be employed to get a faster quantum algorithm for ClosestPair in a moderate number of dimensions.

研究动机与目标

  • 設計針對基本聚類問題的高效差分私密算法,其近似比與最佳非私密算法一致。
  • 在保持 $n$ 和 $d$ 多項式時間複雜度的前提下,最小化私密聚類中的加法誤差。
  • 改進先前僅達常數因子近似的算法,或需指數時間的相關工作。
  • 設計支援高效動態更新的私密 ClosestPair 數據結構,進而實現更緊密的聚類界。
  • 展示私密聚類原 primitive 在提升 Sample and Aggregate 框架與加速量子算法方面的實用性。

提出的方法

  • 設計一種差分私密數據結構,用於維護距離閾值 $\xi$ 內的點對,採用基於 Voronoi 的單元劃分與錯誤校正碼技術。
  • 使用私密的最近向量問題(CVP)算法將每個點映射至其最近的單元,從而實現高效定位與更新操作。
  • 採用列表解碼算法識別給定單元周圍 $2\sqrt{\xi}$ 內的所有單元,從而實現距離相關更新的高效傳播。
  • 維護輔助計數器 $q^{\text{marked-cell}}$、$p^{\text{total}}_{\leq\xi}$ 及每單元狀態 $M[c]$,以追蹤唯一與接近的點對。
  • 定義二元函數 $\Lambda$,用於檢測插入或刪除點時接近點對數量的變化,確保更新傳播正確。
  • 使用與歷史無關的雜湊技術,確保數據結構與歷史無關,進而於動態更新下維持隱私保證。

实验结果

研究问题

  • RQ1差分私密聚類算法能否實現與最佳非私密算法一致的近似比?
  • RQ2在多項式時間複雜度下,差分私密 $k$-means 和 $k$-median 聚類可達的最小加法誤差為何?
  • RQ3如何設計支援高效動態更新且保持差分隱私的私密 ClosestPair 數據結構?
  • RQ4私密聚類原 primitive 是否可用於改進私密機器學習中的 Sample and Aggregate 框架?
  • RQ5私密聚類算法對在中等維度下加速量子算法有何影響?

主要发现

  • 本文提出首個差分私密 $1$-Cluster 算法,其近似比為 $(1+\alpha, \tilde{O}(\sqrt{d}/\epsilon))$(對任意 $\alpha > 0$),與最佳非私密近似比一致。
  • 針對 $k$-means 和 $k$-median 聚類,所提算法在 $n$ 和 $d$ 的多項式時間內實現 $(1+\alpha, \tilde{O}(\sqrt{d}/\epsilon))$-近似比。
  • 私密 ClosestPair 數據結構支援 $2^{O(d)}$ 時間的更新,並可加速中等維度下的 ClosestPair 量子算法。
  • 該框架透過在私密聚合中實現更緊的誤差界,改進了 Sample and Aggregate 框架。
  • 結果表明,差分隱私並非必然導致近似品質與效率之間的權衡,可在僅引入微小加法誤差的情況下達成近乎最優的近似比。
  • 對於 $1$-Cluster 和 DensestBall,方法達成 $O(\sqrt{d}/\epsilon)$ 的加法誤差,此結果在標準複雜度假設下為漸近緊緻。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。