[論文レビュー] Uneven Coverage of Natural Disasters in Wikipedia: the Case of Flood
本研究では、検証済みのグローバル洪水データベースと自動テキストマッチングを用いて、英語ウィキペディアにおける洪水災害の不均一なカバレッジを分析した。その結果、特に米国やカナダを含む高所得・英語圏国に顕著なバイアスが見られ、低所得国および南米諸国における洪水のカバレッジが著しく不足していることが判明した。これは、ウィキペディアのデータに依存する災害対応システムにとって深刻な制限を示している。
The usage of non-authoritative data for disaster management presents the opportunity of accessing timely information that might not be available through other means, as well as the challenge of dealing with several layers of biases. Wikipedia, a collaboratively-produced encyclopedia, includes in-depth information about many natural and human-made disasters, and its editors are particularly good at adding information in real-time as a crisis unfolds. In this study, we focus on the English version of Wikipedia, that is by far the most comprehensive version of this encyclopedia. Wikipedia tends to have good coverage of disasters, particularly those having a large number of fatalities. However, we also show that a tendency to cover events in wealthy countries and not cover events in poorer ones permeates Wikipedia as a source for disaster-related information. By performing careful automatic content analysis at a large scale, we show how the coverage of floods in Wikipedia is skewed towards rich, English-speaking countries, in particular the US and Canada. We also note how coverage of floods in countries with the lowest income, as well as countries in South America, is substantially lower than the coverage of floods in middle-income countries. These results have implications for systems using Wikipedia or similar collaborative media platforms as an information source for detecting emergencies or for gathering valuable information for disaster response.
研究の動機と目的
- 英語ウィキペディアにおける洪水災害のカバレッジバイアスの程度と性質を評価すること。
- 経済状態、地理的要因、言語の観点から、国ごとの洪水報道における系統的な格差を特定すること。
- 災害リスク低減および危機対応アプリケーションのデータソースとして、ウィキペディアの信頼性を評価すること。
- 今後の共同プラットフォームにおけるメディアバイアスに関する研究を支援するため、グローバル洪水イベントの検証済みリファレンスデータセットを提供すること。
提案手法
- 水文学者や国連機関など複数の独立した情報源から得たデータを統合し、包括的かつ実地検証済みの洪水イベントデータセットを構築した。
- 時系列的および地理的エンティティの一致を用いて、自動テキストマッチング技術を適用し、確認済みの洪水イベントと関連するウィキペディア記事をリンクした。
- 機械学習に基づく地理的位置特定と時系列マッチングを用いて、特定の洪水イベントを参照するウィキペディアエントリを同定した。
- 異なるデータプロバイダー間でのイベントマッチングの正確性と一貫性を確保するため、複数のソースを統合した検証アプローチを採用した。
- GDP、GNI、所得水準、英語話者人口などの国レベル指標とウィキペディアのカバレッジを相関させる統計解析を実施した。
- 統合済みの洪水データセット、マッチング済みのウィキペディアエントリ、および再現性を確保するためのコードをオープンソース化した。
実験結果
リサーチクエスチョン
- RQ1ウィキペディアにおける洪水災害のカバレッジは、高所得国および英語圏国にどれほど偏っているか?
- RQ2経済発展度や地理的地域が異なる国々における、ウィキペディアにおける洪水イベントのカバレッジはどのように異なるか?
- RQ3死亡者数と、洪水イベントがウィキペディアにカバーされる可能性との間にどのような関係があるか?
- RQ4言語的・言語的近接性が、洪水イベントがウィキペディアに記録される確率に与える影響は何か?
- RQ5低所得国および脆弱な国々における洪水イベントは、グローバル洪水データと比較してどれほど低くカバレッジされているか?
主な発見
- 特に米国やカナダを含む高所得国における洪水は、世界的な発生頻度に比べて、ウィキペディアで著しく過剰にカバーされている。
- 所得水準が最も低い国々および南米諸国は、中所得国に比べて、ウィキペディアでのカバレッジが著しく低い。
- スダント(2018年)のような、死亡者数が非常に多い洪水災害でさえ、複数の権威ある情報源が報じていたにもかかわらず、ウィキペディアには記録がなかった。
- 洪水イベントがウィキペディアにカバーされる可能性は、国のGDPおよび英語話者の数と強く相関している。
- ウィキペディアのカバレッジには「エリート」国に向けた明確なバイアスがあり、歴史的なニュース価値のパターンを反映しており、発展途上国および英語を話さない国々の出来事はほとんど注目されていない。
- 本研究は、ウィキペディアの災害報道における深刻な空白を特定し、危機対応や災害リスク低減のためのグローバルかつ公平な情報源としてのその有用性を損なっていることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。