[論文レビュー] Diving Deep into Clickbaits: Who Use Them to What Extents in Which Topics with What Effects?
本稿では、153の米国メディア機関が投稿した167万件のFacebook投稿を分析するため、サブワード埋め込みを用いた深層学習ベースのクリックベイト検出モデルを提案する。モデルは98.3%の精度を達成し、信頼性の低いメディアが特にエンタメやパーソナライズドなトピックにおいて、クリックベイトをより広く使用していることが明らかになった。また、高い否定的反応が伴う一方で、ユーザーのエンゲージメントにやや混合した影響を示した。
The use of alluring headlines (clickbait) to tempt the readers has become a growing practice nowadays. For the sake of existence in the highly competitive media industry, most of the on-line media including the mainstream ones, have started following this practice. Although the wide-spread practice of clickbait makes the reader's reliability on media vulnerable, a large scale analysis to reveal this fact is still absent. In this paper, we analyze 1.67 million Facebook posts created by 153 media organizations to understand the extent of clickbait practice, its impact and user engagement by using our own developed clickbait detection model. The model uses distributed sub-word embeddings learned from a large corpus. The accuracy of the model is 98.3%. Powered with this model, we further study the distribution of topics in clickbait and non-clickbait contents.
研究の動機と目的
- SNS上におけるマスメディアおよび信頼性の低いメディア機関におけるクリックベイト使用の度合いとパターンを調査すること。
- メディア投稿におけるクリックベイトと非クリックベイトコンテンツの間で、トピック分布がどのように異なるかを検討すること。
- Facebookにおけるシェア数、コメント数、リアクション数といったユーザーのエンゲージメント指標に、クリックベイト見出しが与える影響を評価すること。
- 手動で設計された特徴量を一切使用せずに、サブワード埋め込みを活用する、堅牢で自動化されたクリックベイト検出システムの開発。
- 今後のクリックベイトおよびメディア信頼性に関する研究のための、公開可能なデータセットと語彙埋め込みの提供。
提案手法
- 大規模なニュース見出しおよびコンテンツコーパスから学習された分散サブワード埋め込みを用いて、教師ありのクリックベイト分類モデルを訓練した。
- 最小限の特徴工学的処理で済むように、文の埋め込み上にソフトマックス分類器を適用し、クリックベイトと非クリックベイトの見出しを区別した。
- 語の共起に基づくトピックモデリングを用いて、メディアタイプごとのクリックベイトおよび非クリックベイトコンテンツにおけるトピック分布を分析した。
- 学習済みの埋め込みを用いて、見出しと記事の序文間の意味的類似度を測定し、見出しの正確性を評価した。
- Facebookのエンゲージメントデータ(リアクション、コメント、シェア)を収集・分析し、クリックベイトと非クリックベイト投稿におけるユーザー相互作用を比較した。
- 事前学習済みのGoogle News word2vec埋め込みとの比較評価を通じて、独自に学習したサブワード埋め込みが優れた性能を示した。
実験結果
リサーチクエスチョン
- RQ1マスメディアおよび信頼性の低いメディア機関は、SNSプラットフォームでどれほどクリックベイト見出しを使用しているのか?
- RQ2さまざまなメディアタイプにおいて、クリックベイトと非クリックベイトの見出しのトピック分布はどのように異なるのか?
- RQ3シェア数、コメント数、リアクション数という観点から、クリックベイト見出しと非クリックベイト見出しのどちらがより高いユーザーのエンゲージメントを生み出すのか?
- RQ4従来の単語埋め込みと比較して、サブワード埋め込みベースのモデルはクリックベイト見出し検出においてどれほど効果的なのか?
- RQ5見出しと本文の内容の一致度(見出しと序文の類似度)が、ユーザーのエンゲージメントに与える影響は何か?
主な発見
- 提案されたクリックベイト検出モデルは98.3%の精度を達成し、Google News word2vec埋め込みに基づくモデルを上回った。
- 信頼性の低いメディア機関は、マスメディアと比較して著しく高い頻度でクリックベイト見出しを使用しており、特に放送メディアが最も高い割合を示した。
- クリックベイトコンテンツは、エンタメ、パーソナライズド、ライフスタイルといったトピックに著しく集中しており、ニュースや時事問題はクリックベイトの使用が少ない傾向にあった。
- クリックベイト見出しに対して高い否定的反応が見られた一方で、非伝統的メディアがクリックベイトに依存しているコンテンツでは、シェア数やコメント数においてわずかに高いエンゲージメントが観察された。
- 記事内容を誤って表現したり、内容と一致しない(見出しと序文の類似度が低い)見出しは、クリックベイトである可能性が高かった。これは、約束と実際の提供に乖離があることを示唆している。
- 本研究では、ユーザーの反応がエンゲージメントを信頼できる指標と見なせないことが判明した。否定的反応が低バイラリティを意味するとは限らず、コンテンツ共有行動における複雑なダイナミクスが存在することが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。