[論文レビュー] The COVID-19 Infodemic: Can the Crowd Judge Recent Misinformation Objectively?
本研究では、一般のクラウドワーカーが最近の新型コロナウイルス関連の誤情報の真実性を客観的に評価できるかを調査している。カスタム検索インターフェースと行動ログの活用により、クラウドソーシングが信頼できる真実性判断をもたらすことが判明した。特に、ワーカーが選択したウェブソースからテキストをコピーした場合に顕著であり、ワーカーの背景や行動が判断の質と顕著に相関しており、これにより新たな集約手法の改善に向けた手がかりが得られた。
Misinformation is an ever increasing problem that is difficult to solve for the research community and has a negative impact on the society at large. Very recently, the problem has been addressed with a crowdsourcing-based approach to scale up labeling efforts: to assess the truthfulness of a statement, instead of relying on a few experts, a crowd of (non-expert) judges is exploited. We follow the same approach to study whether crowdsourcing is an effective and reliable method to assess statements truthfulness during a pandemic. We specifically target statements related to the COVID-19 health emergency, that is still ongoing at the time of the study and has arguably caused an increase of the amount of misinformation that is spreading online (a phenomenon for which the term "infodemic" has been used). By doing so, we are able to address (mis)information that is both related to a sensitive and personal issue like health and very recent as compared to when the judgment is done: two issues that have not been analyzed in related work. In our experiment, crowd workers are asked to assess the truthfulness of statements, as well as to provide evidence for the assessments as a URL and a text justification. Besides showing that the crowd is able to accurately judge the truthfulness of the statements, we also report results on many different aspects, including: agreement among workers, the effect of different aggregation functions, of scales transformations, and of workers background / bias. We also analyze workers behavior, in terms of queries submitted, URLs found / selected, text justifications, and other behavioral data like clicks and mouse actions collected by means of an ad hoc logger.
研究の動機と目的
- 現在進行中の新型コロナウイルスパンデミック中に、非専門家のクラウドワーカーが最近の感受性の高い健康関連の誤情報の真実性を客観的に判断できるかを評価すること。
- ワーカーの背景、認知的行動、情報探索パターンが真実性判断の質に与える影響を分析すること。
- URL選択、テキストの正当化パターン、インタラクションログなどの行動シグナルが、ワーカーの正確性を予測し、集約手法を改善できるかを調査すること。
- 特に真実性スケールの極端なカテゴリ(例:「パンツを履いた火」や「偽り」)における、クラウドソーシングによるラベルの信頼性を、専門家ラベルと比較して評価すること。
- 収集したデータセットと行動ログを公開し、誤情報検出および真実性評価分野における今後の研究を支援すること。
提案手法
- クラウドワーカーは、すべての操作(クリック、マウス移動、入力行動など)を記録するカスタム構築された検索インターフェースを用いて、8件の最近の新型コロナウイルス関連の主張の真実性を判断するタスクを実施した。
- ワーカーは5段階のスケールで真実性評価を行い、URLとテキスト的正当化を提出し、ウェブソースからの証拠を引用することが義務付けられた。
- 行動ログを用いて、正当化に含まれるテキストが選択されたURLからコピーされたかどうかを含む、詳細なインタラクションデータを収集した。
- ワーカーの質は、専門家が検証済みのラベルとの比較により評価され、予測誤差とCEM${}^{ ext{ORD}}$スコアを用いて正確性が測定された。
- ラベル品質の向上を目的として、集約関数とスケール変換のテストが実施され、ワーカーの政治的自己認識はバイアスの影響を評価するために用いられた。
- 統計的分析により、テキストコピーの有無や自由入力の使用といった行動パターンが、判断の正確性と誤差分布に与える影響が相関分析された。
実験結果
リサーチクエスチョン
- RQ1非専門家のクラウドワーカーは、新型コロナウイルスパンデミック中に最近の感受性の高い健康関連の誤情報の真実性を客観的に評価できるか?
- RQ2ワーカーの背景と自己申告された政治的傾向は、判断の質とどのように相関するか?
- RQ3URL選択、テキストコピー、正当化パターンといった行動シグナルのうち、どのものがワーカーの正確性を予測できるか?
- RQ4集約されたクラウド判断が、特に「パンツを履いた火」や「偽り」のような極端なカテゴリにおいて、専門家が検証済みの真実性ラベルにどの程度一致するか?
- RQ5クリック、マウス操作、テキスト正当化パターンといった行動データは、今後の真実性ラベル付けの集約手法を改善するために利用可能か?
主な発見
- クラウドワーカーは、最近の新型コロナウイルス関連の主張の真実性を客観的に評価する能力を示し、集約されたクラウドラベルと専門家ラベルとの間に高い一致を示したが、最も極端な2つのカテゴリ(「パンツを履いた火」と「偽り」)を除いては顕著であった。
- 選択したURLからテキストを正当化にコピーしたワーカーは、予測誤差が著しく低く(0.62 vs. 0.58)、CEM${}^{ ext{ORD}}$スコアが高かった(0.62 vs. 0.58)ことから、判断の質が優れていた。
- 予測誤差の分布は非対称であり、真実性の過剰評価(正の誤差)が頻発しており、特に「偽り」や「パンツを履いた火」とラベル付けされた主張で顕著であった。
- ワーカーはfact-checkingサイトや健康関連のウェブサイトを含む複数のソースを利用しており、正当化行動のパターンが正確性と強く相関していた。
- ワーカーの自己申告された政治的背景が、ラベルの質を示す指標であったことから、人種的・文化的要因が判断の信頼性に影響を与える可能性が示唆された。
- テキストコピーの行動やソース引用パターンといった行動シグナルは、今後のクラウドソーシングによる真実性評価の集約手法改善に向けた、有望で測定可能な指標を提供している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。