Skip to main content
QUICK REVIEW

[論文レビュー] ArCov-19: The First Arabic COVID-19 Twitter Database with Propagation Networks

Fatima Haouari, Maram Hasanain|arXiv (Cornell University)|Apr 18, 2020
Misinformation and Its Impacts参考文献 21被引用数 4
ひとこと要約

ArCOV-19 は、2020年1月27日から3月31日までにアラブ世界における初期の新型コロナウイルス感染症パンデミックをカバーする、公開済みのアラビア語ツイッター・データセットの最初のものであり、約748,000件のポピュラーなツイートとその拡散ネットワーク(リツイートおよび返信スレッド)を含む。これは自然言語処理、情報検索、およびソーシャルコンピューティング分野における研究を可能にし、検索クエリと言語に依存しないクローラーを公開することで、今後のデータセット整備を支援する。

ABSTRACT

In this paper, we present ArCOV-19, an Arabic COVID-19 Twitter dataset that covers the period from 27th of January till 31st of March 2020. ArCOV-19 is the first publicly-available Arabic Twitter dataset covering COVID-19 pandemic that includes around 748k popular tweets (according to Twitter search criterion) alongside the propagation networks of the most-popular subset of them. The propagation networks include both retweets and conversational threads (i.e., threads of replies). ArCOV-19 is designed to enable research under several domains including natural language processing, information retrieval, and social computing, among others. Preliminary analysis shows that ArCOV-19 captures rising discussions associated with the first reported cases of the disease as they appeared in the Arab world. In addition to the source tweets and the propagation networks, we also release the search queries and the language-independent crawler used to collect the tweets to encourage the curation of similar datasets.

研究の動機と目的

  • アラブ世界における新型コロナウイルス感染症パンデミック初期段階のアラビア語ソーシャルメディア・データセットが公に利用可能でないという問題に対処すること。
  • 構造化された拡散ネットワークを備えた、COVID-19関連のアラビア語ツイートのスケールが大きく、高品質なデータセットを提供すること。
  • 自然言語処理、情報検索、およびソーシャルコンピューティング分野の研究を支援するため、ツイートに加えて、元の検索クエリとクローラーのコードを公開すること。

提案手法

  • 2020年1月27日から3月31日までの期間と事前に定義されたキーワードに基づいて、Twitterの検索APIを用いてアラビア語ツイートを収集すること。
  • Twitterのポピュラリティ基準を適用して、最もリツイートされ、関与の高いツイートを選別し、約748,000件のツイートに至ること。
  • 最もポピュラーなツイートのサブセットについて、リツイートおよび会話的な返信スレッドを含む拡散ネットワークを抽出すること。
  • 今後の類似したアラビア語ソーシャルメディア・データセットの再現と整備を容易にするために、言語に依存しないウェブクローラーを設計すること。
  • 元の検索クエリとクローラーのコードを公開することで、データセット収集における透明性と再現可能性を促進すること。

実験結果

リサーチクエスチョン

  • RQ1パンデミック初期段階において、アラブ世界における新型コロナウイルス感染症に関する公的議論はどのように変化したか?
  • RQ2パンデミック初期段階におけるアラビア語ツイッター上での情報拡散の構造的特徴は何か?
  • RQ3リツイートと会話的スレッドは、アラビア語のCOVID-19関連コンテンツの拡散にどのように異なる影響を及えたか?
  • RQ4このデータセットは、アラビア語のような低リソース言語における下流の自然言語処理およびソーシャルコンピューティングアプリケーションをどの程度サポートできるか?
  • RQ5類似した多言語ソーシャルメディア・データセットを整備するにあたり、標準化できるメソドロジー的実践は何か?

主な発見

  • このデータセットは、アラブ世界における新型コロナウイルス感染症の最初の報告例に関連する議論の出現と拡大を捉えている。
  • ArCOV-19 には、リツイートおよび返信スレッドの詳細な拡散ネットワークを備えた、約748,000件のポピュラーなアラビア語ツイートが含まれている。
  • データセットは、リツイートによる急速な拡散と、返信スレッドにおける複雑な会話的ダイナミクスを示す、明確な情報拡散パターンを明らかにしている。
  • 検索クエリと言語に依存しないクローラーの公開により、類似したデータセットの再現可能でスケーラブルな整備が可能になった。
  • 予備的分析により、このデータセットはパンデミック初期段階におけるリアルタイムの公的感情と情報共有を反映していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。