Skip to main content
QUICK REVIEW

[論文レビュー] METS-CoV: A Dataset of Medical Entity and Targeted Sentiment on COVID-19 Related Tweets

Peilin Zhou, Zeqiang Wang|arXiv (Cornell University)|Sep 28, 2022
Misinformation and Its Impacts被引用数 10
ひとこと要約

本稿では、COVID-19関連ツイートにおける医療用語と的を絞った感情を含む、7種類のエンティティタイプと感情ラベルを備えた、医療分野における最初のデータセットであるMET-S-CoVを紹介する。Named Entity Recognition(NER)と的を絞った感情分析(TSA)の両方において、従来の機械学習モデルと最先端の深層学習モデルをベンチマーク化した結果、両分野においてさらなる改善の余地が顕在された。本研究は、医療ソーシャルメディア分析と公衆衛生研究の基盤的リソースを確立するものである。

ABSTRACT

The COVID-19 pandemic continues to bring up various topics discussed or debated on social media. In order to explore the impact of pandemics on people's lives, it is crucial to understand the public's concerns and attitudes towards pandemic-related entities (e.g., drugs, vaccines) on social media. However, models trained on existing named entity recognition (NER) or targeted sentiment analysis (TSA) datasets have limited ability to understand COVID-19-related social media texts because these datasets are not designed or annotated from a medical perspective. This paper releases METS-CoV, a dataset containing medical entities and targeted sentiments from COVID-19-related tweets. METS-CoV contains 10,000 tweets with 7 types of entities, including 4 medical entity types (Disease, Drug, Symptom, and Vaccine) and 3 general entity types (Person, Location, and Organization). To further investigate tweet users' attitudes toward specific entities, 4 types of entities (Person, Organization, Drug, and Vaccine) are selected and annotated with user sentiments, resulting in a targeted sentiment dataset with 9,101 entities (in 5,278 tweets). To the best of our knowledge, METS-CoV is the first dataset to collect medical entities and corresponding sentiments of COVID-19-related tweets. We benchmark the performance of classical machine learning models and state-of-the-art deep learning models on NER and TSA tasks with extensive experiments. Results show that the dataset has vast room for improvement for both NER and TSA tasks. METS-CoV is an important resource for developing better medical social media tools and facilitating computational social science research, especially in epidemiology. Our data, annotation guidelines, benchmark models, and source code are publicly available (https://github.com/YLab-Open/METS-CoV) to ensure reproducibility.

研究の動機と目的

  • COVID-19パンデミック期におけるソーシャルメディア上での一般の感情分析を目的とした、医療分野特有のデータセットの不足に対処すること。
  • 実世界のTwitterの議論において、医療用語(例:薬剤、ワクチン)とそれらに対するユーザーの感情を両方とも捉えるデータセットの開発。
  • 疫学的および公衆衛生研究に特化した、より正確なNLPツールの開発を支援すること。
  • 再現可能なベンチマーク、アノテーションガイドライン、およびコードの提供を通じて、医療分野における計算的社会科学の発展を促進すること。

提案手法

  • 本データセットは、TwitterのAPIを介して取得した10,000件の公開済み匿名化済みCOVID-19関連ツイートから構築された。
  • 合計7種類のエンティティタイプがアノテーション処理された:医療関連4種(疾患、薬剤、症状、ワクチン)と一般3種(人物、場所、組織)。
  • 的を絞った感情分析では、4種類のエンティティタイプ(人物、組織、薬剤、ワクチン)が選択され、感情極性(肯定的、否定的、中立的)がラベル付けされた。
  • 一貫性を確保し、主観性を低減するために、複数ラウンドのトレーニング、ペアアノテーション、第三者による検証を含む厳密なアノテーションプロトコルが適用された。
  • 本データセットを用いて、Named Entity Recognition(NER)およびTSAタスクの両方において、古典的機械学習モデルと最先端の深層学習モデルのベンチマーク評価が実施された。
  • データセット、アノテーションガイドライン、およびコードはGitHubに公開され、再現可能性とコミュニティによる再利用を確保した。

実験結果

リサーチクエスチョン

  • RQ1ノイズが多く、非公式なCOVID-19関連ツイートにおける医療用語の名前付きエンティティ認識(NER)タスクにおいて、既存のNLPモデルはどの程度の性能を示すか?
  • RQ2的を絞った感情分析モデルは、ソーシャルメディアの文章内において、特定の医療用語(例:ワクチン、薬剤)に対するユーザーの感情をどの程度正確に区別できるか?
  • RQ3実世界の医療ソーシャルメディアデータにおいて、ラベルの不均衡と感情アノテーションの主観性がモデル性能に与える影響はどの程度か?
  • RQ4提案されたデータセットは、公衆衛生および医療ソーシャルメディア分析分野における将来のNLPモデルの学習および評価のための信頼できるベンチマークとして機能できるか?

主な発見

  • MET-S-CoVデータセットには、10,000件のツイートが含まれており、7種類のエンティティタイプ(医療用語4種を含む)と、的を絞った感情分析のための5,278件のツイートにわたる9,101件の感情ラベル付きエンティティが含まれる。
  • ベンチマーク評価の結果、既存のモデルはNERおよび的を絞った感情分析の両タスクにおいて、顕著な改善の余地があることが示された。これは、本データセットの複雑さと、モデル開発に向けた価値の高さを示している。
  • データセットには顕著なラベルの不均衡が見られ、特に感情アノテーションにおいて中立的ラベルの割合が高く、モデルの汎化性能に悪影響を及える要因となっている。
  • エンティティタイプごとの性能に差が見られ、希少エンティティではF1スコアが低く抑えられていることが判明した。これは、より良いデータ拡張技術やドメイン適応型モデリングの必要性を示唆している。
  • 構造的なガイドライン、トレーニング、検証を経て、アノテーションプロセスは高いアノテーター間一貫性を達成した。これは、根本的な課題にもかかわらず、主観性を低減した証左である。
  • データセット、ガイドライン、コードの公開により、再現可能な研究が可能となり、公衆衛生応用分野におけるより正確でドメイン特化型のNLPツールの開発を支援する基盤が整った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。