[論文レビュー] VaccineLies: A Natural Language Resource for Learning to Recognize Misinformation about the COVID-19 and HPV Vaccines
本稿では、Twitterにおける新型コロナウイルスワクチンおよびHPVワクチンの誤情報に関するツイート、誤情報標的(MisTs)、およびスタンスアノテーションを含む大規模な自然言語リソースであるVaccineLiesを紹介する。本リソースは、誤情報検出およびスタンス同定のための教師あり学習を可能にし、異なるワクチン間での転移学習における事前学習および微調整によって、HPV用で94.5、COVID-19用で84.0の最先端のF1スコアを達成した。
Billions of COVID-19 vaccines have been administered, but many remain hesitant. Misinformation about the COVID-19 vaccines and other vaccines, propagating on social media, is believed to drive hesitancy towards vaccination. The ability to automatically recognize misinformation targeting vaccines on Twitter depends on the availability of data resources. In this paper we present VaccineLies, a large collection of tweets propagating misinformation about two vaccines: the COVID-19 vaccines and the Human Papillomavirus (HPV) vaccines. Misinformation targets are organized in vaccine-specific taxonomies, which reveal the misinformation themes and concerns. The ontological commitments of the Misinformation taxonomies provide an understanding of which misinformation themes and concerns dominate the discourse about the two vaccines covered in VaccineLies. The organization into training, testing and development sets of VaccineLies invites the development of novel supervised methods for detecting misinformation on Twitter and identifying the stance towards it. Furthermore, VaccineLies can be a stepping stone for the development of datasets focusing on misinformation targeting additional vaccines.
研究の動機と目的
- ソーシャルメディアにおけるワクチン誤情報検出のためのアノテート済みデータセットの不足に応えること。特に、新型コロナウイルスワクチンおよびHPVワクチンに関して。
- ワクチン関連の議論に繰り返し現れるテーマと懸念を捉える、体系的な誤情報標的(MisTs)の分類体系の構築。
- 少なくとも1つのMisTを引き起こすツイートを収集・キュレートし、各ツイートに対して明示的なスタンスラベル(受容、拒否、スタンスなし)を付与する大規模なデータセットの収集とアノテーション。
- 異なるワクチン間での誤情報検出およびスタンス同定のための訓練・開発・テスト分割を提供することで、ワクチン間での転移学習を可能にすること。
- NLPモデルが大規模に誤情報を特定・是正できるようにすることで、公衆衛生対策を支援すること。
提案手法
- Wikipediaから広く議論されている誤解を抽出し、トレンドとなったTwitterの会話分析を通じて、MisTsを特定。
- ワクチン別にMisTsの分類体系を構築し、DNAの改変やワクチン禁止といったテーマや懸念ごとに誤情報を分類。
- 各ワクチンに対して1,000件以上のツイートIDを収集・キュレートし、言語専門家による検証を経て、少なくとも1つのMisTを引き起こすものと確認。
- 専門家が検証済みのラベル付けを用いて、各ツイートに対して、誘発されたMisTに対するスタンス(受容、拒否、スタンスなし)をアノテーション。
- BERTベースのモデル(BERT-VMEDおよびBERT-VMSI)を、4つの転移学習シナリオ(古典的学習、ゼロショット、統合学習、事前学習/微調整)で訓練および評価。
- CoVaxLies(新型コロナウイルスワクチン)およびHpVaxLies(HPVワクチン)の別々のテストセットで、精度、再現率、F1スコアを用いて性能を評価。
実験結果
リサーチクエスチョン
- RQ1Twitter上での新型コロナウイルスワクチンおよびHPVワクチンを標的とした誤情報において、支配的であるテーマと懸念は何か?
- RQ2新しいワクチンに対して学習データが限られる状況下で、転移学習は誤情報検出にどの程度効果的か?
- RQ31つのワクチンで訓練されたスタンス検出モデルは、他のワクチンに一般化可能か?また、異なる転移学習シナリオにおける性能はどのように変化するか?
- RQ4BERTベースのモデルは、VaccineLiesデータセットを用いて、誤情報の誘発と著者のスタンスの両方を同定する上で、どの程度の性能を示すか?
- RQ5事前学習、微調整、統合学習などの異なる訓練戦略は、誤情報検出およびスタンス分類にどのような影響を与えるか?
主な発見
- Pre-Trainシナリオが、HPVワクチンデータセット(HpVaxLies)における誤情報スタンス同定で最高のF1スコア94.5を達成し、他の転移学習戦略を上回った。
- 誤情報検出に関しては、Pre-TrainアプローチがCoVaxLiesでF1スコア91.7、HpVaxLiesで94.5を達成し、異なるワクチン間での強い一般化性能を示した。
- ゼロショット転移学習シナリオも競争力のある結果を示し、スタンス同定においてCoVaxLiesで73.5、HpVaxLiesで74.6のF1スコアを記録し、ターゲットドメインのデータがなくても実用的であることが示された。
- 両ワクチンで統合学習を行うことで、HpVaxLiesでは性能が向上したが、CoVaxLiesでは向上しなかった。これは、ワクチン間で誤情報のパターンに非対称性がある可能性を示唆している。
- Pre-Trainシナリオ下で、BERT-VMSIモデルはCoVaxLiesでマクロF1スコア84.0、HpVaxLiesで83.6を達成し、スタンス同定において優れた性能を示した。
- データセットの分類体系から、明確な誤情報のテーマが明らかになった。新型コロナウイルスワクチンに関しては、mRNAがDNAを改変する懸念が顕著であった。HPVワクチンに関しては、禁止や企業の利益追求を巡る陰謀論が一般的であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。