[論文レビュー] Analysing the Extent of Misinformation in Cancer Related Tweets
本稿では、がん関連のつぶやき20,137件のデータセットを提示し、がんの原因や治療法に関する誤情報の検出のためにアテンションを組み込んだBiLSTM-CRFモデルを構築した。誤情報は表面的な数値よりも顕著に広がっており、治療法に関するつぶやきの76.19%、原因に関するつぶやきの53.32%が誤情報であることが判明。虚偽の内容を示す主な言語的兆候として、だまし、信頼の問題、感情表現が特定された。
Twitter has become one of the most sought after places to discuss a wide variety of topics, including medically relevant issues such as cancer. This helps spread awareness regarding the various causes, cures and prevention methods of cancer. However, no proper analysis has been performed, which discusses the validity of such claims. In this work, we aim to tackle the misinformation spread in such platforms. We collect and present a dataset regarding tweets which talk specifically about cancer and propose an attention-based deep learning model for automated detection of misinformation along with its spread. We then do a comparative analysis of the linguistic variation in the text corresponding to misinformation and truth. This analysis helps us gather relevant insights on various social aspects related to misinformed tweets.
研究の動機と目的
- SNS上におけるがんに関する健康誤情報の増加という問題に対処するため、がん関連のつぶやきを公開可能なデータセットとして構築すること。
- がんの原因や治療法を扱う医療的に関連するつぶやきを自動的に特定する手法を開発すること。
- 深層学習と言語的特徴分析を用いて、がん関連のつぶやきにおける誤情報を検出し、分析すること。
- Twitter上のがんに関する議論において、誤情報と正確な情報とを区別するための言語的および社会的特徴を調査すること。
提案手法
- 原因、治療法、予防に関するキーワードを用いて、29日間にわたりTwitter Streaming APIを活用し、20,137件の固有のがん関連つぶやきを収集した。
- URL、メンション、絵文字を除去し、キャメルケースおよびヒューリスティクスを用いてハッシュタグを分割することで、つぶやきを前処理した。
- 「医療的に関連するつぶやき」として、がんの具体的な原因や治療法を言及するつぶやきを定義し、比喩的または非医療的使用は除外した。
- 医療的に関連するつぶやきからエンティティ(原因/治療法)を抽出するために、アテンションを組み込んだBiLSTM-CRFモデルを提案した。
- LIWC、NRC、Empathなどの複数のNLP辞書を用いて、真実のつぶやきと誤情報のつぶやきを比較するための251の言語的特徴を抽出した。
- 統計的T検定を実施し、誤情報と正確なつぶやきの間で顕著な言語的差を同定し、主な特徴のオッズ比を報告した。
実験結果
リサーチクエスチョン
- RQ1Twitter上のがん関連のつぶやきにおける誤情報の広がりはどの程度か、特に原因や治療法に関して。
- RQ2誤情報を含むつぶやきと正確な医療情報を持つつぶやきの間で、言語的特徴にどのような差があるか。
- RQ3誤情報の広がりは、誤情報が含まれるつぶやきの数よりもどの程度大きいのか。
- RQ4がんの原因や治療法に関する誤情報と最も関連しやすいキーワードは何か。
- RQ5アテンションを組み込んだBiLSTM-CRFモデルは、がん関連のつぶやきにおける誤情報検出にどの程度有効か。
主な発見
- 原因に関する誤情報は、関連するつぶやきの53.32%に存在し、初期のカウントよりも顕著に広がっており、高い拡散が確認された。
- 治療法に関するコンテンツでは、76.19%のつぶやきが誤情報であり、その誤情報の広がりは、そのようなつぶやきの数よりも顕著に大きかった。これは、ウイルス的拡散が起こっている可能性を示唆している。
- アテンションを組み込んだBiLSTM-CRFモデルは、がんの原因に関する誤情報検出でF1スコア0.6846を達成し、治療法に関する誤情報検出には代替アプローチを用いることでF1スコア0.7363を達成した。
- 誤情報のつぶやきは、だまし(オッズ比1.860)、信頼の問題(1.884)、喜び(1.287)や罵倒語(1.920)を含む感情表現が顕著に多く含まれていた。
- 真実のつぶやきは科学的表現(オッズ比-3.402)が強く、悲しみ(-1.103)を示し、恐怖や死に関連する語彙も多く含まれており、より臨床的なトーンであることが示された。
- 誤情報のつぶやきは、より魅力的(オッズ比3.770)であり、ジャーナリストの注目を引きやすい(1.616)傾向にあり、メディアによる拡散が広がりの主な要因であると考えられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。