Skip to main content
QUICK REVIEW

[论文解读] Decision Tree Classification on Outsourced Data

Koray Mancuhan, Chris Clifton|arXiv (Cornell University)|Oct 18, 2016
Privacy-Preserving Technologies in Data参考文献 18被引用 3
一句话总结

该论文提出了一种协作式决策树学习方法(cdtl),用于在l-多样性匿名化模型下的外包数据,其中云服务器执行大部分训练,而客户端通过轻量级优化来提升准确性。该方法在客户端计算和内存使用显著减少的同时,实现了接近非私有决策树的准确性。

ABSTRACT

This paper proposes a client-server decision tree learning method for outsourced private data. The privacy model is anatomization/fragmentation: the server sees data values, but the link between sensitive and identifying information is encrypted with a key known only to clients. Clients have limited processing and storage capability. Both sensitive and identifying information thus are stored on the server. The approach presented also retains most processing at the server, and client-side processing is amortized over predictions made by the clients. Experiments on various datasets show that the method produces decision trees approaching the accuracy of a non-private decision tree, while substantially reducing the client's computing resource requirements.

研究动机与目标

  • 在敏感属性和标识属性被分割并加密的外包l-多样化数据上,实现准确的决策树学习。
  • 在基于云的数据外包模型中,最小化客户端的计算和存储开销。
  • 评估客户端与云服务器之间的协作学习是否能生成与非私有模型几乎同样准确的决策树。
  • 评估在隐私保护环境下,客户端资源节省与模型准确性的权衡。

提出的方法

  • 数据被划分为两张表:标识符表(准标识符)和敏感属性表,连接键被加密以防止链接攻击。
  • 云数据库服务器(CDBS)使用匿名化且l-多样的数据集,在碎片化数据上学习一个基础决策树(BDT)。
  • 客户端以BDT的最大叶节点作为起点,利用本地数据实时进行优化,从而最小化客户端计算量。
  • 客户端优化包括从BDT的最大叶节点重新训练子树,并应用剪枝以避免过拟合。
  • 通过比率衡量执行时间和内存节省:ets = cdtl_time / cnl_time 和 ms = cdtl_memory / cnl_memory,其中cnl为非私有基线模型。
  • 实验采用10折交叉验证,并使用一致的剪枝集合,以公平比较cdtl、cdbsl(仅云)和cnl(非私有)模型。

实验结果

研究问题

  • RQ1能否在使用协作式客户端-服务器模型的外包l-多样化数据上,准确学习到决策树?
  • RQ2在保持高预测准确性的同时,客户端计算和内存使用能减少到何种程度?
  • RQ3在多种数据集上,协作模型(cdtl)的准确性与非私有模型和仅云模型相比如何?
  • RQ4在隐私保护环境下,客户端资源节省与模型复杂性之间的权衡如何,特别是过拟合方面?

主要发现

  • cdtl模型的预测准确性始终接近非私有基线(cnl),在所有数据集上的平均准确性差距在2%至5%之间。
  • 当CDBS上的基础决策树(BDT)越复杂时,执行时间节省(ets)和内存节省(ms)达到最大值,表明客户端效率更高。
  • 仅使用云端基础树的cdbsl模型准确率最差,证实客户端优化对性能至关重要。
  • 当BDT叶节点大小过小(内存节省过高)时,cdtl模型会出现过拟合,尤其在Adult数据集中,准确率因模型复杂度过高而下降。
  • 该方法显著降低了客户端的学习和推理成本,内存和时间节省比率(ets和ms)在有利情况下趋近于零。
  • 建议设定BDT叶节点大小的内存节省阈值以缓解过拟合,尽管最优值因数据集而异,难以普遍定义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。