Skip to main content
QUICK REVIEW

[논문 리뷰] How Well Do My Results Generalize Now? The External Validity of Online Privacy and Security Surveys

Jenny Tang, Eleanor Birrell|arXiv (Cornell University)|2022. 02. 28.
Privacy, Security, and Data Protection인용 수 13
한 줄 요약

이 연구는 MTurk와 Prolific에서 실시한 온라인 개인정보 및 보안 설문조사의 외부 타당성을 평가하기 위해, MTurk(n=800), 성별 균형을 맞춘 Prolific(n=800), 대표성 있는 Prolific(n=800) 샘플의 응답을 펀드 리서치 센터의 확률적 설문조사(n=4,272)와 비교한다. 연구 결과, 지난 5년 간 MTurk 응답의 대표성은 악화되었으며, Prolific 데이터는 인식과 경험에 대해서는 일반적으로 대표적이지만 지식이나 행동에 대해서는 그렇지 않다. 따라서 주의 검사 및 CAPTCHA를 피하고 Prolific을 우선 고려할 것을 권장한다.

ABSTRACT

Privacy and security researchers often rely on data collected through online crowdsourcing platforms such as Amazon Mechanical Turk (MTurk) and Prolific. Prior work -- which used data collected in the United States between 2013 and 2017 -- found that MTurk responses regarding security and privacy were generally representative for people under 50 or with some college education. However, the landscape of online crowdsourcing has changed significantly over the last five years, with the rise of Prolific as a major platform and the increasing presence of bots. This work attempts to replicate the prior results about the external validity of online privacy and security surveys. We conduct an online survey on MTurk (n=800), a gender-balanced survey on Prolific (n=800), and a representative survey on Prolific (n=800) and compare the responses to a probabilistic survey conducted by the Pew Research Center (n=4272). We find that MTurk response quality has degraded over the last five years, and our results do not replicate the earlier finding about the generalizability of MTurk responses. By contrast, we find that data collected through Prolific is generally representative for questions about user perceptions and experiences, but not for questions about security and privacy knowledge. We also evaluate the impact of Prolific settings, attention check questions, and statistical methods on the external validity of online surveys, and we develop recommendations about best practices for conducting online privacy and security surveys.

연구 동기 및 목표

  • 2013–2017년 기간 동안의 이전 연구에서 주장한 바와 같이, MTurk에서의 개인정보 및 보안 주제에 대한 응답이 여전히 미국 인구의 대표성을 유지하고 있는지 평가하기 위해.
  • 특히 인식, 경험, 개인정보 및 보안에 대한 지식에 대해 Prolific 설문조사의 외부 타당성을 평가하기 위해.
  • 주의 검사 질문, CAPTCHA, 레이킹의 영향이 온라인 설문조사 결과의 일반화 가능성에 미치는 영향을 조사하기 위해.
  • 플랫폼의 진화와 데이터 품질 변화를 고려하여, 온라인 개인정보 및 보안 설문조사의 실시 및 분석에 대한 최신 지침을 제공하기 위해.
  • 온라인 샘플에서 소수자 그룹의 부재를 강조하고, 표집 전략을 개선하기 위한 권고를 제시하기 위해.

제안 방법

  • 응답 품질과 대표성 평가를 위해 MTurk에서 800명의 참가자 대상 설문조사를 실시하였다.
  • 인구 통계적 균형과 응답 일반화를 평가하기 위해, Prolific에서 성별 균형을 맞춘 설문조사에 800명을 모집하였다.
  • 국가 대표성 있는 펀드 리서치 센터 설문조사(n=4,272)와 비교하기 위해, 대표성 있는 Prolific 설문조사에 800명을 모집하였다.
  • 통계적 비교 및 레이킹 기법을 사용하여, 인구 통계적 및 행동 변수에 따른 대표성 수준을 평가하였다.
  • 읽기 기반, 개방형 텍스트, CAPTCHA를 포함한 세 가지 유형의 주의 검사가 데이터 품질과 외부 타당성에 미치는 영향을 평가하였다.
  • 연령, 인종, 교육 수준, 성별 하위군의 응답 패턴을 분석하여 하위군의 대표성 수준을 평가하였다.

실험 결과

연구 질문

  • RQ150세 미만이거나 일부 대학 교육 이수자인 MTurk 응답자들이 개인정보 및 보안 설문 질문에 대해 여전히 미국 인구의 대표성을 유지하고 있는가?
  • RQ2주의 검사 질문과 레이킹이 MTurk 응답의 일반화 가능성에 얼마나 기여하는가?
  • RQ3Prolific 응답은 어떤 질문 유형에 대해서나 더 넓은 미국 인구에 대해 얼마나 잘 일반화되는가?
  • RQ4MTurk와 Prolific에서 온라인 개인정보 및 보안 설문조사의 실시 및 분석에 대한 현재 최선의 실천 방법은 무엇인가?
  • RQ5부족하게 표현된 인구 통계적 하위군은 개인정보 및 보안 인식에서 어떻게 다를까? 그리고 이들을 설문조사에서 더 잘 표현하기 위해선 어떻게 해야 하는가?

주요 결과

  • 2017년 이후 MTurk 응답의 품질은 심각하게 악화되었으며, 이 연구는 이전 연구에서 MTurk 응답이 50세 미만 또는 일부 대학 교육 이수자에게 대표적이라는 결론을 재현하지 못했다.
  • Prolific 응답은 개인정보 및 보안 인식, 경험, 신념에 관해 일반적으로 미국 인구의 대표성을 유지하지만, 지식이나 행동 관련 질문에는 그렇지 않다.
  • 주의 검사에 실패한 39%의 MTurk 응답을 제외하고 레이킹을 적용한 후에도 MTurk 데이터는 여전히 대표적이지 않아, 데이터 품질의 근본적 악화를 시사한다.
  • 주의 검사 질문—특히 읽기 기반 및 CAPTCHA 검사—는 Prolific에서 데이터 품질 향상에 효과적이지 않았고, 불필요하게 설문조사의 길이를 늘렸다. 텍스트 상자 주의 검사에서 실패한 참가자는 1,600명 중 7명 뿐이었다.
  • Prolific 샘플에서 레이킹은 대표성에 미미한 영향을 미쳤으며, 이는 현재 Prolific 데이터에는 레이킹이 필수적이지 않음을 시사하지만, 다른 맥락에서는 여전히 유용할 수 있다.
  • 대표성 있는 Prolific 샘플에서 인종, 연령, 교육 수준 하위군은 미국 인구의 해당 하위군과 중간 수준의 대표성을 유지하고 있으나, 전반적으로 Prolific 사용자는 일반 인구에 비해 더 기술에 능숙한 편이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.