Skip to main content
QUICK REVIEW

[论文解读] Data collaboration analysis for distributed datasets

Akira Imakura, Tetsuya Sakurai|arXiv (Cornell University)|Feb 20, 2019
Privacy-Preserving Technologies in Data参考文献 9被引用 4
一句话总结

该论文提出了一种针对分布式数据集的数据协作分析方法,仅集中化各机构特有的中间表示——通过各机构独立且不共享的映射函数生成——从而在保护数据隐私的同时避免模型集中化。通过使用锚点数据和基于SVD的变换将这些表示对齐至一个公共协作空间,该方法实现了无需共享原始数据或模型参数的集中式学习,相较于单独分析,预测性能得到提升。

ABSTRACT

In this paper, we propose a data collaboration analysis method for distributed datasets. The proposed method is a centralized machine learning while training datasets and models remain distributed over some institutions. Recently, data became large and distributed with decreasing costs of data collection. If we can centralize these distributed datasets and analyse them as one dataset, we expect to obtain novel insight and achieve a higher prediction performance compared with individual analyses on each distributed dataset. However, it is generally difficult to centralize the original datasets due to their huge data size or regarding a privacy-preserving problem. To avoid these difficulties, we propose a data collaboration analysis method for distributed datasets without sharing the original datasets. The proposed method centralizes only intermediate representation constructed individually instead of the original dataset.

研究动机与目标

  • 在不集中原始数据或模型参数的情况下,实现对分布式数据集的协作机器学习。
  • 解决大规模去中心化数据分析中,特别是在医疗等敏感领域,面临的隐私与可扩展性挑战。
  • 通过融合多个分布式数据集的洞察,使预测性能超越单一机构的分析结果。
  • 开发一种不依赖密码学或差分隐私的方法,降低计算开销。
  • 确保原始数据无法通过中间表示重建,因为映射函数未被共享。

提出的方法

  • 每个机构使用私有的、不可逆的映射函数 $f_i$ 计算其特有的中间表示 $\widetilde{X}_i = f_i(X_i)$。
  • 使用锚点数据(公共或虚拟数据)创建一个公共参考空间:$\widetilde{X}_i^{\text{anc}} = f_i(X^{\text{anc}})$。
  • 将所有机构的中间表示集中并组合成一个矩阵 $[\widetilde{X}_1^{\text{anc}}, \dots, \widetilde{X}_d^{\text{anc}}]$。
  • 对该组合矩阵应用奇异值分解(SVD),提取左奇异向量 $U_1$,作为对齐的共享基。
  • 为每个机构计算一个变换矩阵 $G_i = U_1^T (\widetilde{X}_i^{\text{anc}})^\dagger$,以将其自身的中间表示 $\widetilde{X}_i$ 映射到公共协作空间。
  • 将对齐后的表示 $\widehat{X}_i = G_i \widetilde{X}_i$ 合并为全局训练集 $\widehat{X}$,并使用该数据集训练模型 $h$,其真实标签为 $L$。

实验结果

研究问题

  • RQ1我们能否通过在不共享原始数据的前提下实现协作,从而在分布式数据集中实现更高的预测性能?
  • RQ2是否能够将具有机构特异性映射函数的异构中间表示对齐至一个通用且可用的空间?
  • RQ3我们能否避免联邦学习中与模型集中化或密码学技术相关的隐私风险?
  • RQ4与单独分析或完全集中式学习相比,所提出方法的有效性如何?
  • RQ5使用锚点数据和基于SVD的变换是否在确保数据隐私的同时保持了表示的实用性?

主要发现

  • 所提出的方法通过将各机构特有的中间表示对齐至公共协作空间,实现在不共享原始数据或模型参数的前提下进行集中式学习。
  • 通过不共享映射函数 $f_i$,该方法避免了隐私风险,使得从中间表示中重建原始数据变得不可行。
  • 通过使用锚点数据和基于SVD的变换,该方法实现了在维度和映射函数各异的机构之间对异构表示的有效对齐。
  • 与隐私保护密码学和差分隐私相比,该方法计算效率更高,因为它避免了噪声注入或复杂加密操作。
  • 该方法能够基于对齐后的表示训练单一模型,其性能优于各机构单独分析的结果。
  • 该框架具有通用性,可兼容多种降维与特征提取技术,包括PCA、FDA以及深度神经网络组件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。