Skip to main content
QUICK REVIEW

[论文解读] Trilateral Large-Scale OSN Account Linkability Study

Mishari Almishari, Ekin Oğuz|arXiv (Cornell University)|Oct 3, 2015
Authorship Attribution and Profiling参考文献 16被引用 3
一句话总结

本文提出了一项三元大规模风格计量研究,通过写作风格分析在三个异构的在线社交网络(OSN)——Yelp(评论)、Twitter(微博)和Flickr(照片分享)——之间建立用户账户的关联。尽管这些平台的使命和内容类型各不相同,作者仍通过多级关联框架(MLLF)实现了高准确率的账户关联,表明即使仅使用公开的文本数据,跨OSN的隐私保护也受到严重威胁。

ABSTRACT

In the last decade, Online Social Networks (OSNs) have taken the world by storm. They range from superficial to professional, from focused to general-purpose, and, from free-form to highly structured. Numerous people have multiple accounts within the same OSN and even more people have an account on more than one OSN. Since all OSNs involve some amount of user input, often in written form, it is natural to consider whether multiple incarnations of the same person in various OSNs can be effectively correlated or linked. One intuitive means of linking accounts is by using stylometric analysis. This paper reports on (what we believe to be) the first trilateral large-scale stylometric OSN linkability study. Its outcome has important implications for OSN privacy. The study is trilateral since it involves three OSNs with very different missions: (1) Yelp, known primarily for its user-contributed reviews of various venues, e.g, dining and entertainment, (2) Twitter, popular for its pithy general-purpose micro-blogging style, and (3) Flickr, used exclusively for posting and labeling (describing) photographs. As our somewhat surprising results indicate, stylometric linkability of accounts across these heterogeneous OSNs is both viable and quite effective. The main take-away of this work is that, despite OSN heterogeneity, it is very challenging for one person to maintain privacy across multiple active accounts on different OSNs.

研究动机与目标

  • 探究尽管内容类型和平台使命存在差异,用户是否仍可被可靠地关联至三个异构的OSN——Yelp、Twitter和Flickr。
  • 开发一种可扩展且准确的基于风格计量的账户关联模型,且仅依赖公开可获取的文本数据。
  • 评估在用户禁用元数据和私密消息的前提下,同时在多个OSN上保持活跃账户所带来的隐私影响。
  • 评估将关联能力扩展至更大规模账户集的可行性,并探索特征排序以及整合额外风格计量特征的方法。

提出的方法

  • 本研究采用多级关联框架(MLLF),通过在不同OSN间递归应用风格计量特征,逐步缩小候选匹配范围。
  • 从Yelp、Twitter和Flickr上的用户生成文本中提取风格计量特征,包括词频、句长以及功能词使用情况。
  • MLLF框架采用分层方法,在每一级应用不同特征,以逐步过滤并排序潜在匹配项。
  • 该方法假设无法访问私有数据(如地理位置、私密消息),仅依赖公开文本数据,从而为攻击者能力设定下限。
  • 通过在多次运行中随机化特征排序,避免弱特征过早被选中导致的偏差,最终将10次运行的结果取平均。
  • 该框架设计为与账户数量呈线性可扩展,适用于大规模数据集。

实验结果

研究问题

  • RQ1尽管内容类型和平台使命存在差异,用户账户是否仍可有效关联至三个异构的OSN——Yelp、Twitter和Flickr?
  • RQ2当仅能访问公开文本数据、无法获取元数据或私密消息时,风格计量分析在账户关联中的准确率如何?
  • RQ3多级关联框架(MLLF)是否能在100至100,000个用户账户范围内实现高可扩展性与高准确率?
  • RQ4特征排序如何影响关联性能?是否可开发启发式方法以提升匹配准确率?
  • RQ5整合额外特征(如话题标签、标签)或融合来自相似OSN(如Flickr与Instagram)的用户资料,能否进一步提升关联能力?

主要发现

  • 风格计量分析可在三个异构平台(Yelp、Twitter和Flickr)之间实现高度准确的跨OSN账户关联,尽管其内容类型和平台使命存在差异。
  • 多级关联框架(MLLF)即使仅依赖公开可获取的文本数据,也能实现高准确率,表明通过在不同OSN间隔离数据以保护隐私的策略是无效的。
  • 在无法访问地理位置或私密消息的情况下,关联性能依然稳健,表明仅凭公开文本即可实现强大的关联攻击。
  • MLLF框架与账户数量呈线性可扩展,估计将一个未知账户与一百万个已知账户关联的执行时间约为2.5分钟。
  • 在10次运行中对特征排序进行随机化处理显著提升了结果的可靠性,平均结果表现出高度准确的关联性能,表明对特征选择偏差具有鲁棒性。
  • 未来整合额外风格计量特征(如Writeprints工具套件中的特征)以及跨OSN用户资料融合(如结合Twitter与Yelp资料)可能进一步提升关联性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。