[论文解读] Detecting Radical Text over Online Media using Deep Learning
该论文提出了一种基于LSTM的深度学习模型,用于检测在线媒体中的极端主义内容,使用了包含61,601条标注文本的数据集(极端主义、非极端主义、不相关)。该方法在分类极端主义内容方面实现了85.9%的精确率,优于SVM和随机森林等传统机器学习方法,证明了深度学习在大规模识别极端主义文本方面的有效性。
Social Media has influenced the way people socially connect, interact and opinionize. The growth in technology has enhanced communication and dissemination of information. Unfortunately,many terror groups like jihadist communities have started consolidating a virtual community online for various purposes such as recruitment, online donations, targeting youth online and spread of extremist ideologies. Everyday a large number of articles, tweets, posts, posters, blogs, comments, views and news are posted online without a check which in turn imposes a threat to the security of any nation. However, different agencies are working on getting down this radical content from various online social media platforms. The aim of our paper is to utilise deep learning algorithm in detection of radicalization contrary to the existing works based on machine learning algorithms. An LSTM based feed forward neural network is employed to detect radical content. We collected total 61601 records from various online sources constituting news, articles and blogs. These records are annotated by domain experts into three categories: Radical(R), Non-Radical (NR) and Irrelevant(I) which are further applied to LSTM based network to classify radical content. A precision of 85.9% has been achieved with the proposed approach
研究动机与目标
- 为应对极端组织(如ISIS)和圣战主义群体在社交媒体平台上日益增长的在线极端化威胁。
- 通过深度学习克服传统机器学习方法在捕捉极端主义文本语义细微差别的局限性。
- 开发一种自动化、可扩展的系统,用于检测新闻、博客和社交媒体帖子中的极端主义内容。
- 通过利用长短期记忆网络与词嵌入技术,提升分类准确率,超越现有技术。
- 支持社交媒体平台和安全部门主动识别并删除极端主义内容。
提出的方法
- 本研究采用基于LSTM的前馈神经网络,对文本数据中的序列依赖关系进行建模,以实现极端主义内容检测。
- 使用词嵌入表示文本输入,使模型能够在无需人工特征工程的情况下学习语义表示。
- 收集并由领域专家标注了来自新闻、文章和博客的61,601条记录,划分为三类:极端主义(R)、非极端主义(NR)和不相关(I)。
- 通过不同训练集与测试集比例(如80:20)进行模型训练,使用精确率、召回率、F1分数和卡帕系数评估性能。
- 将性能与传统方法(包括SVM、随机森林和最大熵(MaxEnt)分类器)进行基准对比,使用词-文档矩阵作为输入。
- 在测试过程中监控均方误差(MSE),以评估预测稳定性与模型收敛性。
实验结果
研究问题
- RQ1基于LSTM的深度学习模型是否能在检测在线文本中的极端主义内容方面优于传统机器学习算法?
- RQ2引入词嵌入和序列建模如何提升极端主义文本检测的分类准确率?
- RQ3在极端主义文本分类中,平衡模型泛化能力与避免过拟合的最优训练集比例是多少?
- RQ4该模型在处理模糊或具有多重观点的文本时表现如何,这些文本可能降低分类准确率?
- RQ5异质性较强的不相关内容在多分类任务中在多大程度上影响模型性能?
主要发现
- 所提出的基于LSTM的模型在分类极端主义内容方面实现了85.96%的精确率,显著优于SVM(53.50%)、随机森林(73.50%)和最大熵(69.50%)。
- 模型的卡帕系数达到0.796,表明专家标注者之间在数据集上存在高度一致性。
- 在80:20的训练集与测试集比例下观察到最高准确率73.44%,超过该比例后出现过拟合现象。
- 在三分类任务(R、NR、I)中性能下降至34.23%,主要由于“不相关”类别内部高度异质性和模糊性。
- 测试阶段的均方误差(MSE)曲线显示预测行为稳定,表明模型在极端主义内容上的性能表现一致。
- 该模型在精确率方面表现更优,而精确率是安全敏感应用场景中最小化误报的关键指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。