Skip to main content
QUICK REVIEW

[论文解读] Data Leverage: A Framework for Empowering the Public in its Relationship with Technology Companies

Nicholas Vincent, Hanlin Li|arXiv (Cornell University)|Dec 18, 2020
Privacy, Security, and Data Protection参考文献 107被引用 9
一句话总结

本文提出了「数据影响力」——一种框架,使公众能够通过战略性地减少、重新定向或操控其数据贡献,来影响科技公司。基于机器学习、人机交互(HCI)和公平性研究,该框架识别出可操作的数据杠杆,如数据罢工、数据污染和有意识的数据贡献,并提出了政策与技术路径,以增强公众在应对隐私、不平等和人工智能问责问题上的影响力。

ABSTRACT

Many powerful computing technologies rely on implicit and explicit data contributions from the public. This dependency suggests a potential source of leverage for the public in its relationship with technology companies: by reducing, stopping, redirecting, or otherwise manipulating data contributions, the public can reduce the effectiveness of many lucrative technologies. In this paper, we synthesize emerging research that seeks to better understand and help people action this extit{data leverage}. Drawing on prior work in areas including machine learning, human-computer interaction, and fairness and accountability in computing, we present a framework for understanding data leverage that highlights new opportunities to change technology company behavior related to privacy, economic inequality, content moderation and other areas of societal concern. Our framework also points towards ways that policymakers can bolster data leverage as a means of changing the balance of power between the public and tech companies.

研究动机与目标

  • 通过识别根植于公众数据贡献的未被充分利用的杠杆点,来解决科技公司与公众之间权力失衡的问题。
  • 将数据贡献不仅视为被动输入,更视为一种可战略性动员的集体劳动,以推动社会变革。
  • 整合来自机器学习、人机交互(HCI)和公平性研究的跨学科成果,将公众对数据依赖型技术的影响力具体化。
  • 突出政策与技术干预措施,以扩大公众数据影响力,并降低集体行动的门槛。
  • 评估广泛使用数据影响力的社会影响与风险,包括对人工智能系统和平台生态的次级影响。

提出的方法

  • 基于计算技术对人类生成数据的依赖,提出「数据影响力」作为新的概念性框架。
  • 识别并分类关键的「数据杠杆」,如数据罢工、数据污染、有意识的数据贡献以及数据可携性(CDC),作为公众影响力的工具。
  • 利用公平性、问责制和人机交互领域的既有研究,分析每种杠杆的可行性与影响。
  • 提出政策机制,如数据可携性与删除权法律,以制度化并扩大数据影响力。
  • 推荐技术工具以支持集体行动,包括集体影响可视化以及数据罢工或污染的自动化(例如,受AdNauseam启发)。
  • 解决技术挑战,如跨平台的数据兼容性与可携性,以提升基于CDC策略的有效性。

实验结果

研究问题

  • RQ1公众如何战略性地利用其数据贡献,以影响科技公司在隐私、偏见和利润分配等问题上的行为?
  • RQ2个人与集体可采用哪些最具可行性且合乎伦理的数据杠杆,以对数据依赖型平台施加压力?
  • RQ3如何设计政策与技术基础设施,以扩大公众数据影响力并降低集体行动的门槛?
  • RQ4广泛使用数据影响力可能带来哪些潜在的意外后果,包括对人工智能性能和平台生态系统的次级影响?
  • RQ5数据可携性与透明度法律在多大程度上能增强数据罢工与CDC等数据影响力策略的有效性?

主要发现

  • 由于人工智能与推荐系统对用户生成数据的严重依赖,数据影响力成为一种强大但尚未被充分利用的公众影响力机制。
  • 当用户在多个平台上协调一致停止数据贡献时,数据罢工可显著降低数据驱动系统的效果。
  • 在战略性应用下,数据污染可破坏存在偏见或有害的AI模型,尤其在依赖用户反馈或标注的系统中。
  • 有意识的数据贡献(如故意提供误导性或非代表性数据)可被用于挑战监控或歧视性实践。
  • 政策干预措施(如数据可携性与删除权法律)可显著提升数据影响力行动的可扩展性与合法性。
  • 能够可视化集体影响或自动化数据杠杆(例如,通过协助抵制的技术)的技术工具,可降低参与门槛并提升公众参与度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。