[論文レビュー] Wiki Surveys: Open and Quantifiable Social Data Collection
本稿では、オープンエンドのユーザー貢献と定量的でスケーラブルな分析を組み合わせたハイブリッドな社会的データ収集手法「ウィキサーベイ」を紹介する。ウィキペディアの協働的モデルをインspiredし、ユーザーがリアルタイムでアイデアを対比較して順位付けするペアワイズ投票メカニズムを用いる。主な貢献は、票データからアイテム順位とユーザーの好みを推定する強固な統計モデルであり、2つの実世界の事例において、従来のアンケートよりも優れた洞察を生み出すことを実証した。
In the social sciences, there is a longstanding tension between data collection methods that facilitate quantification and those that are open to unanticipated information. Advances in technology now enable new, hybrid methods that combine some of the benefits of both approaches. Drawing inspiration from online information aggregation systems like Wikipedia and from traditional survey research, we propose a new class of research instruments called wiki surveys. Just as Wikipedia evolves over time based on contributions from participants, we envision an evolving survey driven by contributions from respondents. We develop three general principles that underlie wiki surveys: they should be greedy, collaborative, and adaptive. Building on these principles, we develop methods for data collection and data analysis for one type of wiki survey, a pairwise wiki survey. Using two proof-of-concept case studies involving our free and open-source website www.allourideas.org, we show that pairwise wiki surveys can yield insights that would be difficult to obtain with other methods.
研究の動機と目的
- 社会学分野における長年の対立、すなわち閉形式の定量的アンケートとオープンエンドの定性的手法の間の葛藤を解決すること。
- 予期しないインサイトを捉えつつ統計的分析が可能な、スケーラブルで適応的なデータ収集手法を開発すること。
- 研究者がアイデアを事前に定義せず、ユーザーが協働的にアイデアを生成・順位付けすることで、研究者のバイアスを最小限に抑える研究ツールを構築すること。
- AllOurIdeas.orgプラットフォームを用いた2つの実世界の事例を通じて、ウィキサーベイの実現可能性と価値を示すこと。
提案手法
- ウィキサーベイは、3つの根幹的原則に基づいている:グリーディ(即時のデータ収集)、協働的(ユーザー生成コンテンツ)、適応的(入力に基づいて動的に進化)。
- ペアワイズウィキサーベイは、ユーザーが2つのアイデアを比較・順位付けする投票メカニズムを用い、相対的好みのデータセットを生成する。
- 票の結果からアイテムの効用(θ)とユーザーの信頼性を推定する統計モデルを、Bradley-Terry-Luce(BTL)モデルに基づいて採用する。
- データ処理には、不正なセッション分割やタイムアウト誤割り当てなどのセッションエラーを補正する3段階の手順を用いる:データダウンロード、エラー補正、セッション統合。
- パrameter推定には、有効な票で少なくとも1勝1敗以上の記録があるアイテムのみを含める。これにより、信頼性の高い順位推定が保証される。
- 意見行列θは、セッションごとのユーザー固有のアイテム効用の平均として推定され、信頼性の高い推論のための標準誤差補正が施される。
実験結果
リサーチクエスチョン
- RQ1協働的でオープンエンドなアンケート手法が、事前に回答選択肢を定義せずに定量的データを生成できるか。
- RQ2ユーザーが生成したアイデアが、従来のアンケートと比較して、インサイトの多様性と深さにどのように影響を与えるか。
- RQ3ペアワイズ投票メカニズムが、実世界の社会的データ収集中において、安定的かつ解釈可能な順位を生み出す程度はどの程度か。
- RQ4ウィキサーベイが、参加者がアンケート内容を自ら設計することを可能にすることで、データ収集中の研究者のバイアスを軽減できるか。
主な発見
- PlaNYCの事例では、464件のユーザー貢献アイデアが生成され、1,397セッションから26,604件の有効票が集められ、高い関与度とアイデアの多様性が示された。
- OECDの事例では、25,393件の有効票が1,620セッションから得られ、534件のユーザー貢献アイデアが生成され、制度的文脈を越えたスケーラビリティが確認された。
- データクリーニング後、PlaNYCでは710件の誤って報告されたセッションが52件の実際のセッションに統合され、データ品質が向上した。
- 最終的なモデルでは、PlaNYCで269件のアイテム、OECDで285件のアイテムについて、有効な勝敗パターンに基づく信頼性の高いパラメータ推定が行われた。
- 統計モデルは欠損データやセッションエラーを効果的に処理し、ウェブサイト固有のデータ収集アーチファクトを補正した後でも安定した推定値を生成した。
- この手法により、高インパクトなアイデアの特定と、閉形式アンケート形式では見逃されていた、より繊細な公的好みの傾向が明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。