[论文解读] Using Neural Network for Identifying Clickbaits in Online News Media
该论文提出了一种基于双向GRU的神经网络模型,能够从新闻帖子文本中自动学习文本表征,以检测点击诱饵标题,在Clickbait Challenge 2017中以0.0315的均方误差取得第一名,优于其他无需特征工程或外部数据源的模型。
Online news media sometimes use misleading headlines to lure users to open the news article. These catchy headlines that attract users but disappointed them at the end, are called Clickbaits. Because of the importance of automatic clickbait detection in online medias, lots of machine learning methods were proposed and employed to find the clickbait headlines. In this research, a model using deep learning methods is proposed to find the clickbaits in Clickbait Challenge 2017's dataset. The proposed model gained the first rank in the Clickbait Challenge 2017 in terms of Mean Squared Error. Also, data analytics and visualization techniques are employed to explore and discover the provided dataset to get more insight from the data.
研究动机与目标
- 开发一种端到端的深度学习模型,用于在线新闻标题的自动点击诱饵检测。
- 识别postText、targetTitle和targetDescription中对点击诱饵预测最具信息量的文本特征。
- 仅使用原始文本输入且不依赖外部数据,超越Clickbait Challenge 2017中的现有模型。
- 通过将分类任务简化为二值点击诱饵概率预测,而非多类别注释分布,来提升模型效率。
提出的方法
- 双向门控循环单元(GRU)网络以正向和反向处理输入文本,以捕捉上下文依赖关系。
- 使用预训练的GloVe词向量(100维)初始化词嵌入,表示输入标记。
- 将前向和反向GRU的最终隐藏状态拼接,形成每个序列的256维上下文向量。
- 通过带有Sigmoid激活函数的单层感知机计算最终的点击诱饵概率得分。
- 应用Dropout正则化(嵌入层0.2,GRU输入层0.2,GRU输出层0.5)以防止过拟合。
- 模型训练采用小批量梯度下降,批量大小为64,损失函数为均方误差。
实验结果
研究问题
- RQ1在postText、targetTitle和targetDescription三个文本字段中,哪一个能为点击诱饵检测提供最具判别力的信号?
- RQ2深度学习模型是否能在无需人工特征工程的情况下实现点击诱饵检测的最先进性能?
- RQ3在Clickbait Challenge 2017中,基于序列的RNN模型与更复杂的集成模型或多源模型相比表现如何?
- RQ4将预测任务简化为二值点击诱饵概率估计,是否能提升模型效率与泛化能力?
主要发现
- 该模型在Clickbait Challenge 2017中以0.03152的均方误差取得第一名,优于所有其他参赛提交。
- 仅在'postText'字段上进行训练时性能最佳,因其包含人类标注者最相关的信息。
- 与其他测试的嵌入维度相比,100维的GloVe嵌入产生了最低的均方误差。
- 在测试集上,模型的中位数绝对误差为0.122,F1分数为0.670,精确率为0.732,召回率为0.619。
- 模型准确率达到85.5%,R²得分为0.571,表明其具有强大的预测性能。
- 模型仅耗时1分10秒,是比赛中运行速度最快的提交。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。