[論文レビュー] Can The Crowd Identify Misinformation Objectively? The Effects of Judgment Scale and Assessor's Background
本研究では、一般のクラウド作業者が複数の判断尺度を用いて政治的発言の真偽を信頼性を持って評価できるかどうかを調査している。相互評価の一致度が低かっただけでなく、クラウドからのラベルは複数の尺度にわたって集約された結果、専門家の事実確認評価と強く相関しており、評価者の内的な政治的傾向が、特に境界壁建設のような対立的問題において判断の正確性に顕著な影響を及ぼしている。
Truthfulness judgments are a fundamental step in the process of fighting misinformation, as they are crucial to train and evaluate classifiers that automatically distinguish true and false statements. Usually such judgments are made by experts, like journalists for political statements or medical doctors for medical statements. In this paper, we follow a different approach and rely on (non-expert) crowd workers. This of course leads to the following research question: Can crowdsourcing be reliably used to assess the truthfulness of information and to create large-scale labeled collections for information credibility systems? To address this issue, we present the results of an extensive study based on crowdsourcing: we collect thousands of truthfulness assessments over two datasets, and we compare expert judgments with crowd judgments, expressed on scales with various granularity levels. We also measure the political bias and the cognitive background of the workers, and quantify their effect on the reliability of the data provided by the crowd.
研究の動機と目的
- 一般のクラウド作業者が政治的発言の真偽を評価する信頼性を評価すること。
- 異なる判断尺度の粒度が、真偽評価の質に与える影響を検討すること。
- 評価者の政治的背景および認知的能力が、判断の正確性に与える影響を調査すること。
- クラウドが生成した真偽ラベルと専門家の事実確認評価を比較すること。
- クラウド作業者が誤情報評価の際に使用する情報源や戦略を理解すること。
提案手法
- 米国およびオーストラリアの政治家が発言した発言の真偽を、米国在住のクラウド作業者に評価してもらった大規模なクラウドソーシング実験を実施した。
- 事実確認タスク中に情報アクセスを標準化するため、制御されたカスタムWeb検索エンジンを用いた。
- 真偽判断に3種類の尺度を採用した:S3(真/偽/ニュートラル)、S6(3段階尺度)、S100(100段階連続尺度)。
- 評価者の政治的立場(明示的および内的なもの)、認知的能力、発言との地理的関連性に関するデータを収集した。
- 政治的傾向が判断の識別能に与える影響を分析するため、統計的検定(クラスカル・ウォリスH検定、ダナーの多重比較)を適用した。
- 信号対雑音比を向上させるために、隣接するカテゴリを統合することでクラウド判断を集約し、専門家ラベルとの相関を評価した。
実験結果
リサーチクエスチョン
- RQ1RQ1: 本研究で用いられた評価尺度は、クラウドソーシングを用いて政治的発言の真偽ラベルを収集するのに適しているか?
- RQ2RQ2: クラウドラベルと専門家ラベルの関係および合意度、および異なる尺度で収集されたラベル間の関係は何か?
- RQ3RQ3: クラウド作業者は、オンライン誤情報を特定するためにどのような情報源を利用しているか?
- RQ4RQ4: 評価者の背景が、オンライン誤情報の客観的特定に及ぼす影響と役割は何か?
主な発見
- S3、S6、S100のすべての尺度において、クラウド作業者の間で相互評価の一致度が低かったが、集約された判断は専門家の評価と有意に相関していた。
- 判断尺度の選択が、真偽評価の全体的な質に影響を及ぼさなかった。すべての尺度が真/偽の区別を同程度に捉えていた。
- 南部米国国境に壁を建設することに反対する作業者ほど、真偽の区別に際立った識別能(p=0.007)を示した。
- 特に移民政策に関する内的な政治的傾向が、判断の質に統計的に有意な影響を及ぼした(PolitiFact発言のp=0.004)。一方、明示的な政党所属は有意差を示さなかった。
- 作業者は検索結果の1ページ目に掲載された情報源に多く依存しており、事実確認の過程で戦略的な情報探索行動を示していた。
- 気候変動に関する立場に差が見られなかったことから、気候変動問題では差が顕著でないことが示された。これは、問題に特化したバイアス効果の存在を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。