Skip to main content
QUICK REVIEW

[论文解读] Learning over inherently distributed data

Donghui Yan, Ying Xu|arXiv (Cornell University)|Jul 30, 2019
Privacy-Preserving Technologies in Data参考文献 47被引用 4
一句话总结

本文提出了一种通信高效的框架,用于在本质上分布的数据上进行学习,通过使用最小化失真的局部变换,仅需共享小型本地签名,从而实现并行的本地计算并保护数据隐私。该方法在本地签名大小增加时,确保误差渐近趋于零,且对基于连续性的模型(如线性回归和随机森林)提供理论保证。

ABSTRACT

The recent decades have seen a surge of interests in distributed computing. Existing work focus primarily on either distributed computing platforms, data query tools, or, algorithms to divide big data and conquer at individual machines etc. It is, however, increasingly often that the data of interest are inherently distributed, i.e., data are stored at multiple distributed sites due to diverse collection channels, business operations etc. We propose to enable learning and inference in such a setting via a general framework based on the distortion minimizing local transformations. This framework only requires a small amount of local signatures to be shared among distributed sites, eliminating the need of having to transmitting big data. Computation can be done very efficiently via parallel local computation. The error incurred due to distributed computing vanishes when increasing the size of local signatures. As the shared data need not be in their original form, data privacy may also be preserved. Experiments on linear (logistic) regression and Random Forests have shown promise of this approach. This framework is expected to apply to a general class of tools in learning and inference with the continuity property.

研究动机与目标

  • 解决由于组织、运营或隐私限制,数据在多个站点之间固有分布时进行机器学习的挑战。
  • 克服现有分布式计算方法的局限性,这些方法假设数据可以集中聚合,或仅出于计算效率而分布。
  • 开发一种框架,实现在不传输原始数据的前提下进行准确的学习与推理,最小化通信量并保护数据隐私。
  • 理论保证:随着本地签名大小的增加,分布式计算引入的误差趋于消失,确保统计一致性。

提出的方法

  • 提出一种基于最小化失真局部变换的一般性框架,将每个分布式站点的数据映射为紧凑的本地签名。
  • 使用空间划分树(如k-d树)递归地对数据进行分区,确保单元格直径缩小,且切割方式被定义为保持统计连续性。
  • 将“良好切割”定义为将节点概率质量分割在真实中位数的$\sqrt{1+\epsilon}/2$倍因子范围内的切割,以确保分区平衡。
  • 建立坏切割的概率随节点大小呈指数下降,从而在高概率下使树在层级$k$内达到完全状态。
  • 利用决策树在单调变换下的不变性,假设边际分布为均匀分布,从而实现直径缩小的分析。
  • 证明当分区层级数$k$增加时,包含数据点$X$的单元格直径以概率趋于零,从而确保收敛。

实验结果

研究问题

  • RQ1我们能否在不跨站点传输原始数据的前提下,对本质上分布的数据实现准确的学习与推理?
  • RQ2如何确保随着共享本地签名大小的增加,由分布式计算引入的误差逐渐减小?
  • RQ3在此框架下,对于具有连续性特性的学习模型,可以提供哪些理论保证以确保其一致性?
  • RQ4如何在仍能实现跨非相同数据源的有效模型训练的同时,保护数据隐私?
  • RQ5空间划分树在确保局部近似收敛到全局模型方面起到什么作用?

主要发现

  • 随着本地签名大小的增加,该框架在学习与推理中实现渐近误差趋近于零,误差$\rightarrow 0$当$\min(k_1, ..., k_J) \to \infty$。
  • 空间划分树中坏切割的概率随节点大小呈指数下降,从而以高概率确保树在层级$k$内达到完全状态。
  • 随着分区层级数$k$的增加,包含数据点$X$的单元格直径以概率趋于零,这是由于重复进行‘良好切割’所致。
  • 该方法通信高效,仅需共享小型本地签名,避免传输原始数据,从而保护隐私。
  • 实验表明该方法成功应用于线性(逻辑)回归和随机森林,展现出实际应用前景。
  • 理论分析证实,该框架适用于具有‘连续性’特性的广泛学习工具类别,确保统计一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。