[论文解读] Facebook Shadow Profiles
本文量化了Facebook通过嵌入的“点赞”和“分享”按钮追踪非用户网络浏览行为的能力,发现无论是否使用Facebook,Facebook均会追踪约40%的美国互联网用户浏览时间。研究证明,这些数据可准确预测年龄、性别等人口统计特征,导致非用户在未同意的情况下遭受推断性画像的数据外部性影响。
We quantify Facebook's ability to build shadow profiles by tracking individuals across the web, irrespective of whether they are users of the social network. For a representative sample of US Internet users, we find that Facebook is able to track about 40 percent of the browsing time of both users and non-users of Facebook, including on privacy-sensitive domains and across user demographics. We show that the collected browsing data can produce accurate predictions of personal information that is valuable for advertisers, such as age or gender. Because Facebook users reveal their demographic information to the platform, and because the browsing behavior of users and non-users of Facebook overlaps, users impose a data externality on non-users by allowing Facebook to infer their personal information.
研究动机与目标
- 衡量Facebook对平台用户及非用户浏览行为的追踪程度。
- 评估Facebook能否仅通过浏览数据和用户提供的基本信息,为非用户构建准确的影子档案。
- 量化当Facebook用户分享个人信息时,对非用户造成的数据外部性。
- 评估在缺乏用户直接同意的情况下,浏览行为对人口统计特征的预测能力。
- 探讨大规模跨站追踪对隐私、广告和市场集中化的影响。
提出的方法
- 本研究使用具有代表性的美国互联网用户样本,通过Facebook的互动按钮(如“点赞”和“分享”按钮)在第三方网站上收集的专有浏览数据进行分析。
- 利用Cookie技术在用户未与Facebook按钮互动的情况下,仍能跨网站追踪个人,从而实现对Facebook用户和非用户均进行被动数据收集。
- 作者利用机器学习模型,基于浏览行为数据预测人口统计属性(年龄、性别、家庭构成),以Facebook用户自报的人口统计信息作为训练标签。
- 通过将模型输出与实际人口统计数据对比来衡量预测准确率,基线准确率则基于无信息假设计算得出。
- 分析在不同用户群体(Facebook用户与非用户)之间的预测表现,并评估用户数据在提升非用户预测准确性方面的增量价值。
- 本研究估算Facebook所追踪的总浏览时间占比,并通过引入用户数据后预测准确率的提升来量化数据外部性。
实验结果
研究问题
- RQ1无论是否为Facebook用户,Facebook追踪了个人在线浏览活动的多大比例?
- RQ2Facebook仅通过浏览行为和用户提供的数据,能在多大程度上准确预测非用户的人口统计特征?
- RQ3Facebook用户的人口统计数据的引入,如何影响对非用户个人特征预测的准确性?
- RQ4由于Facebook用户的数据共享,对非用户造成的数据外部性有多大?
- RQ5浏览数据的预测能力在不同人口统计群体之间以及不同个人属性之间有何差异?
主要发现
- Facebook追踪了美国互联网用户群体中,Facebook用户与非用户约40%的浏览时间。
- 对于Facebook用户,仅使用浏览行为和用户人口统计数据,模型对年龄的预测准确率比基线高25%,对女性性别的预测准确率比基线高16%。
- 对于非用户,模型对年龄的预测准确率比基线高最多30%,对家庭中儿童存在的预测准确率高14%,对女性性别的预测准确率高6%。
- 引入Facebook用户的人口统计数据显著提升了对非用户预测的准确性,证明了用户向非用户的数据外部性。
- 研究发现,即使在未获得非用户直接同意的情况下,仅通过浏览行为与用户数据的结合,也能有效推断出个人特征。
- 尽管数据访问有限,结果表明Facebook构建影子档案的能力相当强大,可能引发隐私和市场集中化方面的潜在担忧。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。