Skip to main content
QUICK REVIEW

[论文解读] How Well Do My Results Generalize Now? The External Validity of Online Privacy and Security Surveys

Jenny Tang, Eleanor Birrell|arXiv (Cornell University)|Feb 28, 2022
Privacy, Security, and Data Protection被引用 13
一句话总结

本研究通过将MTurk(n=800)的样本、性别平衡的Prolific(n=800)样本以及具有代表性的Prolific(n=800)样本与Pew Research Center的概率抽样调查(n=4,272)进行比较,评估了在线隐私与安全调查在MTurk和Prolific平台上的外部效度。研究发现,过去五年间MTurk样本的代表性显著下降,而Prolific数据在感知与经历方面总体具有代表性,但在知识或行为相关问题上则不然,因此建议优先使用Prolific,并避免使用注意力检查和CAPTCHA。

ABSTRACT

Privacy and security researchers often rely on data collected through online crowdsourcing platforms such as Amazon Mechanical Turk (MTurk) and Prolific. Prior work -- which used data collected in the United States between 2013 and 2017 -- found that MTurk responses regarding security and privacy were generally representative for people under 50 or with some college education. However, the landscape of online crowdsourcing has changed significantly over the last five years, with the rise of Prolific as a major platform and the increasing presence of bots. This work attempts to replicate the prior results about the external validity of online privacy and security surveys. We conduct an online survey on MTurk (n=800), a gender-balanced survey on Prolific (n=800), and a representative survey on Prolific (n=800) and compare the responses to a probabilistic survey conducted by the Pew Research Center (n=4272). We find that MTurk response quality has degraded over the last five years, and our results do not replicate the earlier finding about the generalizability of MTurk responses. By contrast, we find that data collected through Prolific is generally representative for questions about user perceptions and experiences, but not for questions about security and privacy knowledge. We also evaluate the impact of Prolific settings, attention check questions, and statistical methods on the external validity of online surveys, and we develop recommendations about best practices for conducting online privacy and security surveys.

研究动机与目标

  • 评估MTurk在隐私与安全话题上的调查回应是否仍如2013–2017年已有研究所述,代表美国人口。
  • 评估Prolific调查的外部效度,特别是其在隐私与安全感知、经历和知识方面的表现。
  • 调查注意力检查题、CAPTCHA和重加权(raking)对在线调查结果推广性的影。
  • 根据平台演变与数据质量变化,提出开展和分析在线隐私与安全调查的最新最佳实践。
  • 突出在线样本中边缘化群体的代表性不足问题,并推荐针对性的抽样策略。

提出的方法

  • 在MTurk上开展调查,招募800名参与者,以评估回应质量与代表性。
  • 在Prolific上实施性别平衡的调查,招募800名参与者,以评估人口统计平衡与回应的推广性。
  • 在Prolific上实施具有代表性的调查,招募800名参与者,将其回应与全国代表性Pew调查(n=4,272)进行比较。
  • 使用统计比较与重加权技术,评估在人口统计与行为变量上的代表性。
  • 评估三种注意力检查类型——阅读型、开放文本型与CAPTCHA——对数据质量与外部效度的影响。
  • 分析年龄、种族、教育与性别子群体中的回应模式,以评估子群体的代表性。

实验结果

研究问题

  • RQ1MTurk在隐私与安全调查问题上的回应是否仍对50岁以下或接受过部分大学教育的受访者具有代表性?
  • RQ2注意力检查题与重加权在多大程度上提升了MTurk回应的推广性?
  • RQ3Prolific回应在多大程度上能推广至更广泛的美国人口,且在不同类型问题上表现如何?
  • RQ4在MTurk与Prolific上开展和分析在线隐私与安全调查的当前最佳实践是什么?
  • RQ5代表性不足的人口统计子群体在隐私与安全感知方面有何差异,如何能更好地在调查中代表这些群体?

主要发现

  • 自2017年以来,MTurk回应质量显著下降,本研究未能复现早期研究中关于MTurk对50岁以下或接受过部分大学教育的受访者具有代表性的结论。
  • Prolific回应在隐私与安全感知、经历与信念方面总体代表美国人口,但在知识或行为相关问题上则不然。
  • 即使排除了39%未通过注意力检查的MTurk回应,并应用了重加权,MTurk数据仍不具代表性,表明其数据质量存在根本性下降。
  • 注意力检查题——尤其是阅读型与CAPTCHA检查——在Prolific上未能有效提升数据质量,反而不必要地延长了调查时间,仅1,600名参与者中有7人未通过文本框注意力检查。
  • 重加权对Prolific样本的代表性影响极小,表明目前无需对Prolific数据使用重加权,尽管在其他情境下可能仍具价值。
  • 在具有代表性的Prolific样本中,种族、年龄与教育子群体在一定程度上代表了美国人口的对应群体,但Prolific用户整体上比一般人口更具技术倾向。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。