Skip to main content
QUICK REVIEW

[論文レビュー] HumAID: Human-Annotated Disaster Incidents Data from Twitter

Firoj Alam, Umair Qazi|arXiv (Cornell University)|Apr 7, 2021
Public Relations and Crisis Communication被引用数 6
ひとこと要約

本稿では、2016年から2019年の間の19件の災害イベントから抽出された約77,000件のツイートを含む、大規模かつ人間によるアノテーションが施されたHumAIDというデータセットを紹介する。このデータセットは2400万件のツイートから抽出され、災害対応における高度な自然言語処理を支援することを目的としている。著者らは、人間によるアノテーションを目的とした体系的なデータ収集およびサンプリングパイプラインを提案し、fastTextおよびトランスフォーマー型モデルを用いた多値分類の評価を通じて、今後の研究のためのベンチマークを確立した。

ABSTRACT

Social networks are widely used for information consumption and dissemination, especially during time-critical events such as natural disasters. Despite its significantly large volume, social media content is often too noisy for direct use in any application. Therefore, it is important to filter, categorize, and concisely summarize the available content to facilitate effective consumption and decision-making. To address such issues automatic classification systems have been developed using supervised modeling approaches, thanks to the earlier efforts on creating labeled datasets. However, existing datasets are limited in different aspects (e.g., size, contains duplicates) and less suitable to support more advanced and data-hungry deep learning models. In this paper, we present a new large-scale dataset with ~77K human-labeled tweets, sampled from a pool of ~24 million tweets across 19 disaster events that happened between 2016 and 2019. Moreover, we propose a data collection and sampling pipeline, which is important for social media data sampling for human annotation. We report multiclass classification results using classic and deep learning (fastText and transformer) based models to set the ground for future studies. The dataset and associated resources are publicly available.\url{this https URL}

研究の動機と目的

  • 既存の災害関連ツイートデータセットに見られる、規模が小さく、重複が多く、深層学習に不適切な問題を是正すること。
  • 人間によるアノテーションのためのスケーラブルで体系的なソーシャルメディアデータ収集およびサンプリングパイプラインの開発。
  • 深層学習モデルを用いた高度な多値分類を支援する、高品質で大規模なデータセットの構築。
  • 新規データセット上で最先端のモデルを評価することにより、今後の災害NLP分野の研究のためのベンチマークを提供すること。

提案手法

  • 2016年から2019年の間の19件の主要な災害イベントに関連するツイートを、約2400万件のツイートのプールから体系的に抽出するためのデータ収集パイプラインを設計した。
  • クラスのバランスと代表性を確保するためのサンプリング戦略を適用し、冗長性を低減しながら、災害タイプ間の多様性を維持した。
  • 人間のアノテーターが各ツイートを事前に定義された災害関連カテゴリにラベル付けし、合計で約77,000件の完全にアノテートされたツイートが得られた。
  • データセットを用いて、従来型(fastText)および深層学習型(トランスフォーマー基盤)のモデルを用いた多値分類の訓練および評価を実施した。
  • アノテーター間でのラベルの一貫性と信頼性を確保するため、品質管理措置をアノテーションプロセスに組み込んだ。
  • 最終的なデータセットおよび関連コードは、再現可能性とさらなる研究を支援するため、公開された。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー型のような最新の深層学習モデルは、fastTextのような従来型モデルと比較して、災害関連ツイートの分類においてどれほど効果的であるか。
  • RQ2スケーラブルで体系的なデータサンプリングパイプラインは、人間によるアノテーションを目的とした高品質で代表的な訓練データを生成できるか。
  • RQ3大規模で多様性に富み、人間によるアノテーションが施された災害ツイートデータセット上で、多値分類モデルの性能はいかほどか。
  • RQ4本稿で提示されたデータセットは、サイズ、多様性、および深層学習モデルの学習に適した点において、既存のデータセットと比較してどのように差別化されるか。

主な発見

  • HumAIDデータセットには、19件の異なる災害イベントに由来する約77,000件の人的アノテーション付きツイートが含まれており、過去のデータセットと比較して顕著なスケールの向上を示している。
  • 提案されたデータ収集およびサンプリングパイプラインは、データの重複を低減しながらも、クラスの多様性と代表性を維持するのに成功した。
  • トランスフォーマー基盤のモデルは、fastTextを上回る性能を示した。これは、本データセットが高度なモデルの学習に価値をもたらすことを示している。
  • その規模、多様性、および高品質なアノテーションのおかげで、本データセットは災害対応シナリオにおけるNLPモデルのより強固な評価を可能にした。
  • 本データセットおよび関連リソースの公開により、災害NLP分野およびリアルタイム情報処理分野における今後の研究の基盤が提供された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。