[論文レビュー] Counting Protests in News Articles: A Dataset and Semi-Automated Data Collection Pipeline
本論文は、2017年1月から2021年1月までの米国ローカルニュース記事から、手動でキュレートされた42,347件の抗議行動イベントを含むデータセットと、これらのイベントを収集・ラベル付けするための準自動化パイプラインを紹介する。パラグラフレベルの文法的単位を用いた際のF1スコア平均82.6を達成するLSTMベースの分類器をベンチマーク化し、ニュースメディアにおけるイベント抽出のための構造化テキスト解析の有効性を示している。
Between January 2017 and January 2021, thousands of local news sources in the United States reported on over 42,000 protests about topics such as civil rights, immigration, guns, and the environment. Given the vast number of local journalists that report on protests daily, extracting these events as structured data to understand temporal and geographic trends can empower civic decision-making. However, the task of extracting events from news articles presents well known challenges to the NLP community in the fields of domain detection, slot filling, and coreference resolution. To help improve the resources available for extracting structured data from news stories, our contribution is three-fold. We 1) release a manually labeled dataset of news article URLs, dates, locations, crowd size estimates, and 494 discrete descriptive tags corresponding to 42,347 reported protest events in the United States between January 2017 and January 2021; 2) describe the semi-automated data collection pipeline used to discover, sort, and review the 144,568 English articles that comprise the dataset; and 3) benchmark a long-short term memory (LSTM) low dimensional classifier that demonstrates the utility of processing news articles based on syntactic structures, such as paragraphs and sentences, to count the number of reported protest events.
研究の動機と目的
- 構造化されていないローカルニュース記事から抗議イベントの構造化されたデータを抽出する課題に対処すること。これは、市民的・政治的分析にとって不可欠である。
- 日付、場所、群衆の規模、記述タグを含む、詳細なメタデータを備えた大規模で手動ラベル付けされた抗議イベントデータセットを構築すること。
- 数千件のニュース記事を毎晩処理できる、最小限の人的労力を要する準自動化データ収集パイプラインの開発と検証すること。
- 自然言語処理(NLP)モデルの、ニュース記事内における抗議イベントの数え上げ性能を評価すること。特に文法的構造と系列モデルに焦点を当てる。
- 標準化され、アクセス可能なデータを提供することで、将来的なイベント抽出研究、市民データ分析、社会運動の縦断的分析を可能にすること。
提案手法
- データセットには138,826件のニュース記事URLが含まれており、494種の記述タグ(過去/未来の時間的状態、場所、群衆の規模、抗議のテーマなど)を含む42,347件の固有の抗議イベントが手動でラベル付けされている。
- 準自動化パイプラインは、ウェブクローリング、URLの重複除去、類似度に基づくソートを用いて、人間によるレビューの対象となる記事を同定・優先順位付けし、人的労力を削減しながらもデータ品質を維持する。
- 主な手法は、長短記憶ネットワーク(LSTM)を用いて、1記事あたりの抗議イベント数を分類することである。入力として、トークン、文、パラグラフという3つの文法的単位を用いる。
- モデルは、クラスのバランスを保つためにストラティファイドサンプリングを用い、10,000イテレーションにわたりカテゴリカル交差エントロピー損失で訓練され、過学習を防ぐために早期停止を適用する。
- 性能評価は、さまざまな文法的入力単位における正確性(precision)、再現率(recall)、F1スコアを用い、特にパラグラフレベルのエンコーディングで最高の結果が得られた。
- データセットは、URLと例題コードを含む公開GitHubリポジトリを通じてリリースされるが、著作権制限のため、完全なコーパスは配布されない。
実験結果
リサーチクエスチョン
- RQ1最小限の人的介入で、ローカルニュース記事から抗議イベントの収集とラベル付けを効果的にスケーリングできる準自動化パイプラインは存在するか?
- RQ2トークン、文、パラグラフといった文法的単位の選択が、ニュース記事内における抗議イベント数のLSTMモデル性能にどのように影響するか?
- RQ3低次元のLSTM分類器は、0件、1件、2件、または3件以上という抗議イベント数を区別する能力において、相対的にどの程度の性能を示すか?
- RQ4パラグラフのような文法的構造は、イベント数え上げにおける長期依存関係の解消能力を、モデルがどの程度向上させるか?
- RQ5モデルは、実際に抗議を記述していないが抗議関連用語を含む記事(ネガティブ例)をどれだけ効果的に特定できるか?
主な発見
- パラグラフベースのLSTMモデルが、82.6の最高F1スコアを達成し、文ベース(82.9)およびトークンベース(80.4)モデルを上回った。これは、より大きな文法的単位がイベント数え上げの正確性を向上させることを示している。
- ゼロ件の抗議イベントを含む記事の識別において、F1スコアが90.4に達し、非抗議コンテンツに対するドメインの識別能力が非常に高いことが示された。
- 2件の抗議イベントを含む記事の性能は著しく低下し(F1 = 43.2)、主に1件の抗議イベントとして誤分類されることが原因で、二重イベントの区別が困難であることが明らかになった。
- 文ベースのモデルは1件の抗議イベントを含む記事に対してF1が80.5を達成し、トークンモデル(78.3)を上回った。これは、文レベルのエンコーディングが、生トークンよりもイベントの文脈をより良く捉えられることを示している。
- 全クラスの加重平均F1スコアが82.6に達し、イベント数え上げを多クラス分類タスクとして再定式化することが、実行可能で効果的な戦略であることが示された。
- 準自動化パイプラインは、4年間にわたり2名の研究者でのみ138,826件の記事を処理し、反復的なソートとレビューにより高いデータ品質を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。