[论文解读] Diving Deep into Clickbaits: Who Use Them to What Extents in Which Topics with What Effects?
本文提出了一种基于深度学习的点击诱饵检测模型,利用子词嵌入技术分析来自153家美国媒体机构的167万条Facebook帖子。该模型实现了98.3%的准确率,并发现不可靠媒体更广泛地使用点击诱饵,尤其是在娱乐和个人化主题中,尽管负面反应更高,但用户参与度存在混合影响。
The use of alluring headlines (clickbait) to tempt the readers has become a growing practice nowadays. For the sake of existence in the highly competitive media industry, most of the on-line media including the mainstream ones, have started following this practice. Although the wide-spread practice of clickbait makes the reader's reliability on media vulnerable, a large scale analysis to reveal this fact is still absent. In this paper, we analyze 1.67 million Facebook posts created by 153 media organizations to understand the extent of clickbait practice, its impact and user engagement by using our own developed clickbait detection model. The model uses distributed sub-word embeddings learned from a large corpus. The accuracy of the model is 98.3%. Powered with this model, we further study the distribution of topics in clickbait and non-clickbait contents.
研究动机与目标
- 调查主流媒体与不可靠媒体组织在社交媒体平台上使用点击诱饵的程度与模式。
- 研究不同媒体类型中,点击诱饵与非点击诱饵内容的主题分布差异。
- 评估点击诱饵标题对Facebook平台用户参与度指标(如分享、评论与反应)的影响。
- 开发一种基于子词嵌入、无需手工特征工程的稳健自动化点击诱饵检测系统。
- 为未来关于点击诱饵与媒体可信度的研究提供公开可获取的数据集与词嵌入。
提出的方法
- 基于大规模新闻标题与内容语料库中学习到的分布式子词嵌入,训练了一个监督式点击诱饵分类模型。
- 在句子嵌入上应用Softmax分类器,以最小化特征工程的方式区分点击诱饵与非点击诱饵标题。
- 采用基于词共现的主题建模方法,分析不同媒体类型中点击诱饵与非点击诱饵内容的主题分布。
- 利用学习到的嵌入计算标题与文章引言之间的语义相似度,以评估标题的准确性。
- 收集并分析Facebook平台的用户参与数据(反应、评论、分享),比较点击诱饵与非点击诱饵帖子的用户互动差异。
- 将模型性能与预训练的Google News word2vec嵌入进行对比,证明自定义子词嵌入在性能上更优。
实验结果
研究问题
- RQ1主流媒体与不可靠媒体组织在社交媒体平台上使用点击诱饵标题的程度如何?
- RQ2在不同媒体类型中,点击诱饵与非点击诱饵标题的内容主题分布有何差异?
- RQ3在分享、评论与反应方面,哪种标题类型——点击诱饵或非点击诱饵——能带来更高的用户参与度?
- RQ4与传统词嵌入相比,基于子词嵌入的模型在检测点击诱饵标题方面效果如何?
- RQ5标题准确性(通过标题与引言相似度衡量)与用户参与度之间存在何种关系?
主要发现
- 所提出的点击诱饵检测模型达到了98.3%的准确率,优于基于Google News word2vec嵌入的模型。
- 不可靠媒体组织使用点击诱饵标题的频率显著高于主流媒体,广播媒体的使用率最高。
- 点击诱饵内容在娱乐、个性化与生活方式主题中占比过高,而新闻与时事类内容较少使用点击诱饵。
- 尽管点击诱饵标题引发更多负面反应,但依赖点击诱饵的非传统媒体内容在分享与评论方面表现出略高的用户参与度。
- 与文章内容不符或未能准确反映内容的标题(即标题与引言语义相似度低)更可能是点击诱饵,表明标题承诺与实际内容之间存在错配。
- 研究发现,用户反应可能无法可靠预测参与度,挑战了负面反应即代表传播性低的假设,提示内容分享行为中存在复杂的动态机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。