Skip to main content
QUICK REVIEW

[論文レビュー] How Well Do My Results Generalize Now? The External Validity of Online Privacy and Security Surveys

Jenny Tang, Eleanor Birrell|arXiv (Cornell University)|Feb 28, 2022
Privacy, Security, and Data Protection被引用数 13
ひとこと要約

本研究は、MTurkおよびProlificにおけるオンラインのプライバシーおよびセキュリティに関する調査の外部妥当性を評価するために、MTurk(n=800)、性別に配分されたProlific(n=800)、代表的なProlific(n=800)のサンプルを、Pew Research Centerの確率的調査(n=4,272)と比較した。5年間にわたりMTurkの回答は代表性を失いつつあることが判明した一方、Prolificのデータは一般的に認識や経験に関して代表的であるが、知識や行動に関する項目に関してはそうではない。この結果、注意チェックやCAPTCHAの使用を避けるとともに、MTurkよりもProlificを優先すべきであると提言している。

ABSTRACT

Privacy and security researchers often rely on data collected through online crowdsourcing platforms such as Amazon Mechanical Turk (MTurk) and Prolific. Prior work -- which used data collected in the United States between 2013 and 2017 -- found that MTurk responses regarding security and privacy were generally representative for people under 50 or with some college education. However, the landscape of online crowdsourcing has changed significantly over the last five years, with the rise of Prolific as a major platform and the increasing presence of bots. This work attempts to replicate the prior results about the external validity of online privacy and security surveys. We conduct an online survey on MTurk (n=800), a gender-balanced survey on Prolific (n=800), and a representative survey on Prolific (n=800) and compare the responses to a probabilistic survey conducted by the Pew Research Center (n=4272). We find that MTurk response quality has degraded over the last five years, and our results do not replicate the earlier finding about the generalizability of MTurk responses. By contrast, we find that data collected through Prolific is generally representative for questions about user perceptions and experiences, but not for questions about security and privacy knowledge. We also evaluate the impact of Prolific settings, attention check questions, and statistical methods on the external validity of online surveys, and we develop recommendations about best practices for conducting online privacy and security surveys.

研究の動機と目的

  • 2013–2017年の先行研究で主張されたように、MTurkにおけるプライバシーおよびセキュリティ関連の回答が、米国一般の人々の代表的であるかどうかを評価すること。
  • Prolific調査の外部妥当性、特にプライバシーおよびセキュリティに関する認識、経験、知識の分野を評価すること。
  • 注意チェック、CAPTCHA、ラービングの影響が、オンライン調査結果の一般化可能性に与える影響を調査すること。
  • プラットフォームの進化とデータ品質の変化を踏まえ、オンラインのプライバシーおよびセキュリティ調査の実施および分析に関する最新のベストプラクティスを提供すること。
  • オンラインサンプルにおけるマイノリティグループの代表性不足を浮き彫りにし、標本調査戦略の改善を提言すること。

提案手法

  • MTurkで800名の参加者を対象に調査を実施し、回答の質と代表性を評価した。
  • Prolificで性別に配分された800名の参加者を対象に調査を実施し、人口統計的バランスと回答の一般化可能性を評価した。
  • Prolificで代表的な800名の参加者を対象に調査を実施し、全国的代表的Pew調査(n=4,272)と比較した。
  • 統計的比較とラービング技術を用いて、人口統計的および行動的変数における代表性を評価した。
  • 読解型、オープンテキスト型、CAPTCHA型の3種類の注意チェックが、データ品質と外部妥当性に与える影響を評価した。
  • 年齢、人種、教育、性別などのサブグループにおける回答パターンを分析し、サブグループの代表性を評価した。

実験結果

リサーチクエスチョン

  • RQ1MTurkの回答は、50歳未満または一部の大学教育を受けてる人々について、米国一般の人々の代表的であると言えるか?
  • RQ2注意チェックとラービングは、MTurkの回答の一般化可能性をどの程度向上させるか?
  • RQ3Prolificの回答は、さまざまな質問タイプにおいて、米国一般の人々にどの程度一般化できるか?
  • RQ4MTurkおよびProlificにおけるオンラインのプライバシーおよびセキュリティ調査の実施および分析に関する現在のベストプラクティスは何か?
  • RQ5代表されない人口統計的グループは、プライバシーやセキュリティに関する認識でどのように異なるか。また、それらのグループを調査でよりよく代表化するにはどうすればよいか?

主な発見

  • 2017年以降、MTurkの回答の質は著しく低下しており、2013–2017年の先行研究で示されたように、50歳未満または一部の大学教育を受けた人々の回答が米国一般の代表的であるという主張は再現されなかった。
  • Prolificの回答は、プライバシーおよびセキュリティに関する認識、経験、信念に関する質問では一般的に米国一般の代表的であるが、知識や行動に関する質問に関してはそうではない。
  • 39%のMTurク回答が注意チェックに失敗したと除外した後、ラービングを適用しても、MTurkデータは依然として代表的でなかった。これは、データ品質に根本的な低下が生じていることを示している。
  • 注意チェック、特に読解型およびCAPTCHA型のチェックは、Prolificにおけるデータ品質の向上に効果がなく、無駄に調査を長くした。テキストボックス型注意チェックで失敗したのは1,600名中たった7名にとどまった。
  • Prolificのサンプルにおけるラービングは、代表性にほとんど影響を与えず、Prolificデータに関しては現在では必要ではないと示唆されたが、他の文脈では依然として有用である可能性がある。
  • 代表的なProlificサンプルにおける人種、年齢、教育のサブグループは、米国一般の対応するグループとやや代表的であったが、Prolificユーザー全体は一般の人々に比べて技術的素養が高い傾向にあった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。