Skip to main content
QUICK REVIEW

[论文解读] De-anonymization of Social Networks with Communities: When Quantifications Meet Algorithms

Luoyi Fu, Xinzhe Fu|arXiv (Cornell University)|Mar 27, 2017
Privacy-Preserving Technologies in Data参考文献 14被引用 19
一句话总结

本文提出了一种新颖的、基于理论的代价函数,用于利用社区结构对社交网络进行去匿名化,该函数通过最大后验概率(MAP)估计推导得出,旨在最大化正确映射的概率。文中提出了两种具有可证明近似保证的算法——AA 和 CO,在真实跨域网络上表现出色,准确率最高可达 80%,尤其在两个网络中均具备社区信息时表现更优。

ABSTRACT

A crucial privacy-driven issue nowadays is re-identifying anonymized social networks by mapping them to correlated cross-domain auxiliary networks. Prior works are typically based on modeling social networks as random graphs representing users and their relations, and subsequently quantify the quality of mappings through cost functions that are proposed without sufficient rationale. Also, it remains unknown how to algorithmically meet the demand of such quantifications, i.e., to find the minimizer of the cost functions. We address those concerns in a more realistic social network modeling parameterized by community structures that can be leveraged as side information for de-anonymization. By Maximum A Posteriori (MAP) estimation, our first contribution is new and well justified cost functions, which, when minimized, enjoy superiority to previous ones in finding the correct mapping with the highest probability. The feasibility of the cost functions is then for the first time algorithmically characterized. While proving the general multiplicative inapproximability, we are able to propose two algorithms, which, respectively, enjoy an ε-additive approximation and a conditional optimality in carrying out successful user re-identification. Our theoretical findings are empirically validated, with a notable dataset extracted from rare true cross-domain networks that reproduce genuine social network de-anonymization. Both theoretical and empirical observations also manifest the importance of community information in enhancing privacy inferencing.

研究动机与目标

  • 为解决现有社交网络去匿名化代价函数缺乏严格理论依据的问题,通过概率推理为其提供理论基础。
  • 通过引入社区结构,更准确地建模现实世界的社交网络,相较于随机图模型,社区结构更能反映聚类效应。
  • 对所提出的代价函数的最小化问题进行算法表征,确保其在实际应用中的可行性。
  • 在罕见的真实跨域数据集上对方法进行实证验证,以证明其在真实场景下的鲁棒性与有效性,而不仅限于合成数据。

提出的方法

  • 使用随机块模型对底层社交网络进行建模,以捕捉社区结构,该结构作为去匿名化过程中的辅助信息。
  • 基于最大后验概率(MAP)估计推导出新的代价函数,确保最小化该函数可使正确映射具有最高的后验概率。
  • 证明该优化问题在一般情况下具有乘法不可近似的性质,从而建立理论上的计算难度边界。
  • 提出两种算法——AA(近似算法)和 CO(条件最优算法),分别通过松弛技术实现 ε-加性近似和条件最优性。
  • 利用网络拓扑结构和候选映射关系,通过松弛与迭代优化方法,解决代价函数、网络结构与映射关系之间的相互交织问题。
  • 在从随机块模型中采样的合成网络以及真实世界数据集(包括跨域合作者网络)上对方法进行验证。

实验结果

研究问题

  • RQ1能否推导出一种具有严格概率论依据的社交网络去匿名化代价函数,而非依赖启发式设计?
  • RQ2将社区结构作为辅助信息引入后,对去匿名化的准确率与可行性会产生何种影响?
  • RQ3由所提出的代价函数引发的优化问题能否通过算法手段进行表征?可提供何种近似保证?
  • RQ4在真实世界的跨域社交网络中,所提出的算法相较于现有方法表现如何?
  • RQ5在缺乏预先映射种子的情况下,社区信息在多大程度上能提升去匿名化的准确率?

主要发现

  • 所提出的基于 MAP 的代价函数优于以往方法,因为在温和条件下,其最小化结果对应于正确映射的后验概率最高。
  • AA 算法在去匿名化真实采样社交网络时,准确率最高可达 80%,表现出强大的鲁棒性,即使底层网络不严格遵循随机块模型亦成立。
  • 在真实跨域合作者网络中,AA 算法在双边情况下成功去匿名化 60.8% 的节点,在单边情况下为 51.5%,证实了其实际有效性。
  • CO 算法稳定性较低,在各类场景下的标准差均超过 3.5%,表明其对网络结构变化更为敏感。
  • 双边与单边去匿名化之间的准确率差距至少为 3.5%,最高可达 15%,实证结果证实了社区信息在提升去匿名化成功率中的关键作用。
  • 该代价函数在并非由随机块模型生成的真实网络上依然有效,表明其在理想假设之外也具备良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。