Skip to main content
QUICK REVIEW

[论文解读] Deletion-Robust Submodular Maximization at Scale

Ehsan Kazemi, Morteza Zadimoghaddam|arXiv (Cornell University)|Nov 20, 2017
Privacy-Preserving Technologies in Data参考文献 25被引用 3
一句话总结

本论文提出了首个内存高效且可扩展的删除鲁棒子模最大化算法,在基数约束下,实现了集中式和流式设置下的(1/2 − δ)近似,以及分布式设置下的0.218 − δ近似,即使多达d个对抗性元素被删除也能保持性能。该方法通过核心集构建和鲁棒贪心选择,在因隐私或公平性约束导致数据删除时仍能维持性能。

ABSTRACT

Can we efficiently extract useful information from a large user-generated dataset while protecting the privacy of the users and/or ensuring fairness in representation. We cast this problem as an instance of a deletion-robust submodular maximization where part of the data may be deleted due to privacy concerns or fairness criteria. We propose the first memory-efficient centralized, streaming, and distributed methods with constant-factor approximation guarantees against any number of adversarial deletions. We extensively evaluate the performance of our algorithms against prior state-of-the-art on real-world applications, including (i) Uber-pick up locations with location privacy constraints; (ii) feature selection with fairness constraints for income prediction and crime rate prediction; and (iii) robust to deletion summarization of census data, consisting of 2,458,285 feature vectors.

研究动机与目标

  • 解决现有子模优化方法在因隐私或公平性担忧而删除数据元素时缺乏鲁棒性的问题。
  • 设计在未知哪些元素将被删除的前提下,仍能保持高实用性的算法,即使面对最多d个元素的对抗性删除。
  • 确保在集中式和流式模型中实现(1/2 − δ)的常数因子近似保证,在分布式模型中实现0.218 − δ的近似保证,且与d无关。
  • 最小化内存使用,使解的大小相对于d呈次线性增长,从而实现在大规模数据集上的可扩展部署。
  • 在涉及隐私保护数据摘要和公平特征选择的实际应用中展示方法的实用性。

提出的方法

  • 提出Robust-Centralized:一种使用核心集构建的集中式算法,实现(1/2 − δ)近似,内存复杂度为O(k + d log k / δ²)。
  • 设计Robust-Streaming:一种流式算法,内存复杂度为O(k log k / δ + d log²k / δ³),通过鲁棒贪心选择实现(1/2 − δ)近似。
  • 提出Robust-Distributed:一种使用m台机器的分布式算法,实现0.218 − δ近似,内存复杂度为O(m(k + d log k / δ²))。
  • 提出Compact-Distributed:一种内存优化变体,实现0.109 − δ近似,总内存复杂度为O(k + d log k / δ²)。
  • 采用基于相似性的目标函数进行数据摘要:f(S) = ∑_{x∈S} ∑_{x'∈S, x'≠x} (1 − ||x−x'||/√68),建模成对相似性。
  • 应用核心集技术预先计算鲁棒的代表性子集,使其在d个元素被删除后仍保持有效性。

实验结果

研究问题

  • RQ1我们能否设计一种可扩展的子模最大化算法,在未知哪些元素将被删除的前提下,仍能有效应对任意d个对抗性元素的删除?
  • RQ2在保持常数因子近似保证的前提下,如何最小化删除鲁棒子模优化中的内存使用?
  • RQ3我们能否在数据量过大而无法存储于主内存的流式和分布式环境中实现鲁棒性?
  • RQ4当敏感或有偏特征被移除时,删除鲁棒算法的性能与标准贪心方法相比如何?
  • RQ5在涉及隐私和公平性约束的实际应用中,删除鲁棒算法在多大程度上能保持实用性?

主要发现

  • Robust-Centralized和Robust-Streaming在d上仅呈对数增长的内存使用,而以往方法的内存使用与d呈乘法关系,显著优于以往方法。
  • 在Uber接载点数据集上,所提算法在位置隐私约束下优于最先进方法,即使删除高达10%的数据仍能保持高实用性。
  • 在犯罪率预测任务中,集中式和流式算法的RMSE分别为0.163和0.177,优于标准贪心方法(RMSE 0.193),尽管它们事先不知道哪些特征将被删除。
  • 在Census1990数据集(245万个样本)上,Robust-Distributed的归一化目标值超过1.0,表明其性能甚至优于已知删除集合的基线方法。
  • 在80%数据被删除的情况下,分布式算法平均仅存储约4,500个条目(每台机器约450个),成功实现了对245万个数据点的高效摘要,展现出极高的内存效率。
  • Robust-Distributed在所有删除策略(随机删除、基于性别的删除)下均保持强性能,包括在80%条目被删除的极端情况下,验证了其在极端场景下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。