[論文レビュー] Understanding the (In)Effectiveness of Content Moderation: A Case Study of Facebook in the Context of the U.S. Capitol Riot
本研究では、1月6日議会襲撃事件の周辺、米国ニュース出処2,500件の公開された関与データを用いて、フェイスブックのコンテンツ削除タイミングと影響を推定する新規手法を開発した。急速なモデレーションであっても、予測される関与の21%しか防止できないことが判明した。これは、大部分の拡散が30時間以内に発生するためであり、危機時におけるコンテンツモデレーションの構造的限界を浮き彫りにし、拡散速度を遅らせるアルゴリズム的変更の必要性を示唆している。
Social media networks commonly employ content moderation as a tool to limit the spread of harmful content. However, the efficacy of this strategy in limiting the delivery of harmful content to users is not well understood. In this paper, we create a framework to quantify the efficacy of content moderation and use our metrics to analyze content removal on Facebook within the U.S. news ecosystem. In a data set of over 2M posts with 1.6B user engagements collected from 2,551 U.S. news sources before and during the Capitol Riot on January 6, 2021, we identify 10,811 removed posts. We find that the active engagement life cycle of Facebook posts is very short, with 90% of all engagement occurring within the first 30 hours after posting. Thus, even relatively quick intervention allowed significant accrual of engagement before removal, and prevented only 21% of the predicted engagement potential during a baseline period before the U.S. Capitol attack. Nearly a week after the attack, Facebook began removing older content, but these removals occurred so late in these posts' engagement life cycles that they disrupted less than 1% of predicted future engagement, highlighting the limited impact of this intervention. Content moderation likely has limits in its ability to prevent engagement, especially in a crisis, and we recommend that other approaches such as slowing down the rate of content diffusion be investigated.
研究の動機と目的
- 危機時におけるフェイスブックのコンテンツモデレーションが、有害なコンテンツの露出を制限する実世界の有効性を評価すること。
- 公開利用可能な関与データを用いて、削除後のタイミングと関与への影響を推定する手法を開発すること。
- 予測モデルを用いて、削除前の関与量と防止された関与量を定量化すること。
- 議会襲撃のような高関与イベントにおいて、コンテンツモデレーションが有害なコンテンツの拡散を意味的に遮断できるかどうかを評価すること。
- 透明性の向上と、拡散速度の遅延などの代替戦略を含む、プラットフォームの安全性を高めるための提言を行うこと。
提案手法
- 2,551件の米国ニュース出処のFacebook投稿の日々のスナップショットから、投稿の消失を検出することで、コンテンツ削除を推定した。
- 同じページの歴史的関与パターンを用いて、投稿の関与可能性を予測するモデルを開発した。通常およびバズ投稿の両方で3.2–4.5%の誤差を達成した。
- 2つの主要な指標を定義した:『蓄積された関与』(削除前の関与)と『防止された関与』(予測された潜在的関与から実際の関与を差し引いたもの)。
- ベースライン期間を用いて、通常の関与ライフサイクルを推定し、90%の関与が投稿後30時間以内に発生することを確認した。
- 危機期間に対しても同じ指標を適用し、1月12日におけるフェイスブックのポリシー変更前後における削除タイミングと影響を比較した。
- 第三者機関のデータを用いて、出処の事実性の信頼性を分類し、リスクの高いコンテンツが特に多く削除されたかどうかを評価した。
実験結果
リサーチクエスチョン
- RQ1フェイスブックは米国のニュース発信者やインフルエンサーの有害コンテンツをどの程度の速さで削除しており、その削除前にどの程度の関与が発生しているか?
- RQ2予測された関与と実際の関与を比較することで、コンテンツモデレーションが有害なコンテンツの露出をどの程度防止しているか?
- RQ31月6日議会襲撃のような高関与の危機時において、コンテンツモデレーションの有効性はどのように変化するか?
- RQ4投稿の関与ピークに比べて、削除はどの程度遅れて発生しており、その実際の影響は何か?
- RQ5コンテンツモデレーションシステムの評価と設計を改善するために、どのような指標と透明性の実践が有効か?
主な発見
- フェイスブック投稿の関与ライフサイクルは極めて短く、全関与の90%が投稿後30時間以内に発生する。
- 中央値の削除時間は21時間であったが、通常期間中は予測された関与の潜在的関与のうちわずか21.2%しか防止できなかった。
- 議会襲撃の危機期には、初期段階で削除が遅く、効果的でなかった。予測された関与の21%しか防止できず、ベースライン水準と同程度であった。
- フェイスブックは襲撃から6日後の時点で、古いコンテンツの削除を開始したが、そのような遅延した削除は、予測された今後の関与の1%未満にしか影響しなかった。
- ポリシー変更や発表があっても、危機期におけるコンテンツ拡散のスピードに、コンテンツモデレーションは追いつかなかった。
- 結果から、コンテンツモデレーションだけでは有害なコンテンツの拡散を防止できないことが示され、代替戦略(例:拡散速度の遅延)の優先的検討が求められる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。