Skip to main content
QUICK REVIEW

[论文解读] Enhancing Transparency and Control when Drawing Data-Driven Inferences about Individuals

Daizhuo Chen, Samuel P. Fraiberger|arXiv (Cornell University)|Jun 26, 2016
Privacy, Security, and Data Protection参考文献 8被引用 4
一句话总结

本文提出了一种隐蔽机制,使用户能够通过选择性地隐藏(隐蔽)其 Facebook 喜好,来抑制基于数据的个人特质推断。该机制利用证据反事实方法,识别出导致推断的最少数量的喜好。结果表明,用户仅需平均隐藏 5–6 个喜好即可有效抑制推断,但企业可通过切换至利用特征相关性的模型(如朴素贝叶斯)来应对,从而使隐蔽变得显著困难。

ABSTRACT

Recent studies have shown that information disclosed on social network sites (such as Facebook) can be used to predict personal characteristics with surprisingly high accuracy. In this paper we examine a method to give online users transparency into why certain inferences are made about them by statistical models, and control to inhibit those inferences by hiding ("cloaking") certain personal information from inference. We use this method to examine whether such transparency and control would be a reasonable goal by assessing how difficult it would be for users to actually inhibit inferences. Applying the method to data from a large collection of real users on Facebook, we show that a user must cloak only a small portion of her Facebook Likes in order to inhibit inferences about their personal characteristics. However, we also show that in response a firm could change its modeling of users to make cloaking more difficult.

研究动机与目标

  • 探究用户是否能够对其社交媒体数据推断实现有意义的控制。
  • 通过识别预测所需最少证据,评估数据驱动推断的透明度可行性。
  • 评估用户是否可通过仅隐蔽其喜好中的一小部分来抑制推断。
  • 考察建模方法的变化(如朴素贝叶斯与逻辑回归)如何影响隐蔽的难度。
  • 探讨此类控制机制对在线定位系统中隐私、公平性和用户自主权的影响。

提出的方法

  • 该方法使用证据反事实,确定若移除哪些输入特征(喜好)可使模型无法对用户的个人特质做出特定推断。
  • 将其应用于线性模型,其中每个喜好为一个具有关联系数的二值特征,模型得分即为这些加权特征的总和。
  • 通过按其对模型预测得分的影响程度从高到低依次移除喜好来模拟隐蔽,从最具影响力的喜好开始。
  • 在多个模型上测试该方法:逻辑回归(LR)、使用 100 个 SVD 分量的逻辑回归(LRSVD)以及朴素贝叶斯(NB),以比较隐蔽的难易程度。
  • 研究使用 Kosinski 等人(2013)提供的真实 Facebook 数据,训练模型以预测诸如性取向、性别和宗教性等特质。
  • 将‘可隐蔽性’定义为用户需隐蔽的喜好数量,以使预测得分低于某一阈值,同时区分真阳性与假阳性。

实验结果

研究问题

  • RQ1用户需隐蔽多少个喜好才能成功抑制针对其个人特质的数据驱动推断?
  • RQ2对于被正确推断出具有某特质的用户与被错误推断的用户,隐蔽的难易程度有何差异?
  • RQ3不同机器学习模型(如 LR、NB)在多大程度上影响隐蔽推断所需的努力?
  • RQ4企业是否可通过改变其建模方法使隐蔽更困难,从而应对用户控制?
  • RQ5在统计推断系统中,模型性能与隐蔽抵抗能力之间存在何种权衡?

主要发现

  • 在使用逻辑回归或 LRSVD 模型时,用户平均仅需隐蔽 5.5 个喜好即可抑制推断,表明有效隐蔽所需努力极低。
  • 对于被错误推断出具有某特质的用户(假阳性用户),隐蔽明显更容易,且差异具有统计显著性(p < 0.05)。
  • 朴素贝叶斯模型显著提高了隐蔽难度,用户平均需隐蔽 50.6 个喜好才能抑制推断,远高于 LR 和 LRSVD 模型的 5.5 个。
  • 朴素贝叶斯模型隐蔽难度上升的原因在于其将喜好视为条件独立,导致相关喜好被‘重复计算’,从而放大其影响。
  • 企业可通过简单切换至类似朴素贝叶斯的模型,利用特征相关性,无需限制用户数据即可显著增加隐蔽难度。
  • 结果表明,尽管当前模型允许用户以极低努力实现有意义的控制,但企业可通过改变其建模策略来削弱这种控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。