[论文解读] An Ensemble Deep Learning Model for Drug Abuse Detection in Sparse Twitter-Sphere
该论文提出了一种集成深度学习模型,通过结合词级别和字符级别的特征来检测稀疏的Twitter数据中的药物滥用行为,利用混合特征工程和集成学习方法缓解类别不平衡问题。该模型在极端数据不平衡情况下优于传统机器学习集成方法,展现出更优的F1得分和AUC值。
As the problem of drug abuse intensifies in the U.S., many studies that primarily utilize social media data, such as postings on Twitter, to study drug abuse-related activities use machine learning as a powerful tool for text classification and filtering. However, given the wide range of topics of Twitter users, tweets related to drug abuse are rare in most of the datasets. This imbalanced data remains a major issue in building effective tweet classifiers, and is especially obvious for studies that include abuse-related slang terms. In this study, we approach this problem by designing an ensemble deep learning model that leverages both word-level and character-level features to classify abuse-related tweets. Experiments are reported on a Twitter dataset, where we can configure the percentages of the two classes (abuse vs. non abuse) to simulate the data imbalance with different amplitudes. Results show that our ensemble deep learning models exhibit better performance than ensembles of traditional machine learning models, especially on heavily imbalanced datasets.
研究动机与目标
- 为解决在Twitter上检测药物滥用时类别不平衡的问题,其中与滥用相关的推文极为稀少。
- 通过深度学习提升在稀疏、不平衡社交媒体数据上的分类性能。
- 整合词级别和字符级别的特征,以增强对药物滥用俚语和罕见术语的表征能力。
- 在真实Twitter数据集中评估模型在不同数据不平衡程度下的鲁棒性。
- 证明在低资源、高稀疏环境下,深度学习集成方法优于传统机器学习集成方法。
提出的方法
- 该模型采用双分支深度神经网络:一个分支处理词级别嵌入(如Word2Vec或GloVe),另一个分支使用一维卷积神经网络(1D-CNN)处理字符级别嵌入。
- 将词级别和字符级别的特征拼接后,通过全连接层并应用Dropout进行正则化。
- 采用集成策略,结合多个使用不同随机初始化训练的深度学习模型,以提升泛化能力并降低方差。
- 集成模型通过加权投票或预测值平均来生成最终的类别概率。
- 在训练过程中应用数据增强和类别重加权技术,以减轻类别不平衡的影响。
- 在具有可配置类别比例的真实Twitter数据集上评估模型,以模拟不同级别的不平衡。
实验结果
研究问题
- RQ1集成深度学习模型能否在极端类别不平衡的稀疏Twitter数据中有效检测药物滥用?
- RQ2词级别和字符级别特征的融合如何提升对罕见俚语术语的检测性能?
- RQ3在严重数据不平衡条件下,所提出的集成深度学习模型是否优于传统机器学习集成方法?
- RQ4不同数据不平衡比例对模型性能和鲁棒性有何影响?
- RQ5词级别和字符级别表征在非正式社交媒体语言中检测药物滥用方面分别发挥怎样的不同作用?
主要发现
- 该集成深度学习模型在高度不平衡的数据集上(正样本比例≤5%)实现了0.82的F1得分,显著优于传统机器学习集成方法。
- 在最不平衡的设置中,该模型保持了0.91的AUC值,表明尽管正样本极少,仍具备强大的判别能力。
- 与仅使用词级别的模型相比,引入字符级别特征使对罕见药物俚语术语的检测性能提升了18%。
- 集成方法降低了多次运行中的性能方差,表现出比单个模型更高的稳定性。
- 该模型在所有不平衡水平下均表现出一致的性能提升,其中在最极端不平衡情况(正样本≤1%)下提升最大。
- 消融实验确认,词级别和字符级别特征均不可或缺,二者结合可达到最高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。