[論文レビュー] Characterizing the spread of exaggerated news content over social media
本稿では、過剰な健康報道がTwitterでどのように広がるかを調査し、過剰な内容についての遅れて投稿されたツイートは、『感じる』『実感する』などの意見や認識関連語彙の使用が強調されている一方で、否定的または死に関する語彙は少ないことが明らかになった。言語的特徴とユーザ行動を用いて、過剰な内容を頻繁に共有するユーザを分類したところ、F1スコア0.83を達成し、こうしたユーザに特徴的な行動的・言語的パターンが明らかになった。
In this paper, we consider a dataset comprising press releases about health research from different universities in the UK along with a corresponding set of news articles. First, we do an exploratory analysis to understand how the basic information published in the scientific journals get exaggerated as they are reported in these press releases or news articles. This initial analysis shows that some news agencies exaggerate almost 60\% of the articles they publish in the health domain; more than 50\% of the press releases from certain universities are exaggerated; articles in topics like lifestyle and childhood are heavily exaggerated. Motivated by the above observation we set the central objective of this paper to investigate how exaggerated news spreads over an online social network like Twitter. The LIWC analysis points to a remarkable observation these late tweets are essentially laden in words from opinion and realize categories which indicates that, given sufficient time, the wisdom of the crowd is actually able to tell apart the exaggerated news. As a second step we study the characteristics of the users who never or rarely post exaggerated news content and compare them with those who post exaggerated news content more frequently. We observe that the latter class of users have less retweets or mentions per tweet, have significantly more number of followers, use more slang words, less hyperbolic words and less word contractions. We also observe that the LIWC categories like bio, health, body and negative emotion are more pronounced in the tweets posted by the users in the latter class. As a final step we use these observations as features and automatically classify the two groups achieving an F1 score of 0.83.
研究の動機と目的
- 科学的プレスリリースやニュース記事からの過剰な健康報道が、Twitterなどのソーシャルメディアプラットフォームでどのように広がるかを理解すること。
- 過剰な内容をほとんどまたは全く共有しないユーザと、頻繁に共有するユーザとの間の言語的・行動的差異を特定すること。
- 言語的特徴とネットワーク特徴を用いて、ユーザが過剰なニュースを共有する傾向があるかどうかを予測するモデルを構築すること。
- 特に、遅れて投稿されるツイートにおける言語使用の変化を含めた、過剰な報道の共有の時間的ダイナミクスを検討すること。
提案手法
- 本研究では、英国の大学から得た462件のラベル付きプレスリリースと668件のニュース記事のデータセットを用い、因果関係の主張の変化、助言の明確さ、サンプルの同一性に基づく過剰性のラベルを付与した。
- ツイートの言語的特徴を抽出するために、Linguistic Inquiry and Word Count (LIWC)分析を適用し、感情、認知、社会的プロセスに関連するカテゴリ、例えば『賛同』『感じる』『否定的感情』『生物学的』などを含む特徴を抽出した。
- ユーザ行動の分析では、過剰な内容の共有頻度に基づいてユーザを分類した:共有しない(users_NEX)、まれに(users_EX1)、2回(users_EX2)、3回以上(users_EX3)。
- リツイート/メンション数、スラング、比喩的表現、縮約語、ツイート長などの特徴をユーザのタイムラインから抽出し、投稿行動の比較を行った。
- 分類モデルは、これらの特徴を用いて教師あり学習で訓練され、クラスの不均衡を補うために階層的10分割交差検証とクラスウェイトを適用した。
- ランダムフォレストとXGBoost分類器が最も高い性能を示し、過剰な内容をほとんどまたは全く共有しないユーザと頻繁に共有するユーザを区別する際、F1スコア0.83を達成した。
実験結果
リサーチクエスチョン
- RQ1過剰な健康報道に関するツイートの言語的コンテンツは、特に遅れて投稿されるツイートにおいて、時間の経過とともにどのように変化するか?
- RQ2過剰な健康報道を頻繁に共有するユーザとそうでないユーザとの間には、どのような行動的・言語的差異が存在するか?
- RQ3ユーザの投稿パターンと言語的特徴を用いて、そのユーザが過剰なニュースコンテンツを共有する可能性があるかどうかを予測できるか?
- RQ4『賛同』『不安』『宗教』『否定的感情』といったLIWCカテゴリの語彙は、過剰な内容を共有するツイートとそうでないツイートでどのように異なるか?
主な発見
- 過剰な内容を共有する遅れて投稿されたツイートでは、『賛同』『感じる』『宗教』『不安』といったLIWCカテゴリの語彙が顕著に多く使用されており、意見表明や感情的認識の強調が見られた。
- こうした遅いツイートでは、『死』『性的』『悲しみ』『否定的感情』に関連する語彙が弱く、苦痛や終末的言語への注目が薄いことが示された。
- 過剰な内容を頻繁に共有するユーザは、そうした内容をまれにしか共有しないユーザと比較して、著しく多くのフォロワー数を持ち、スラングを多く使用し、比喩的表現は少なく、縮約語も少ない傾向にあった。
- 言語的分析から、過剰な内容を多く投稿するユーザは、自身のツイートにおいてLIWCカテゴリの『生物学的』『健康』『身体』『否定的感情』の語彙をより多く使用していることが明らかになった。
- 分類器は、過剰な内容をほとんどまたは全く共有しないユーザと頻繁に共有するユーザを区別する際、F1スコア0.83を達成した。ランダムフォレストとXGBoostモデルが最も優れた性能を示した。
- 本研究は、時間の経過とともに、集団の知恵(wisdom of the crowd)が、特に意見や認識関連語彙の使用増加といった言語的手がかりを通じて、過剰な内容を特定するのに役立つ可能性があることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。