[论文解读] UTCNN: a Deep Learning Model of Stance Classificationon on Social Media Text
UTCNN 是一种用于社交媒体立场分类的深度学习模型,通过整合用户嵌入、主题表征和评论信息,提升分类准确率。它在英文辩论论坛数据上达到 0.842 的准确率,在中文 Facebook 数据上达到 0.755 的宏平均 F1 分数,显著优于排除用户、主题或评论特征的模型,且在不使用过采样技术的情况下有效缓解了数据不平衡问题。
Most neural network models for document classification on social media focus on text infor-mation to the neglect of other information on these platforms. In this paper, we classify post stance on social media channels and develop UTCNN, a neural network model that incorporates user tastes, topic tastes, and user comments on posts. UTCNN not only works on social media texts, but also analyzes texts in forums and message boards. Experiments performed on Chinese Facebook data and English online debate forum data show that UTCNN achieves a 0.755 macro-average f-score for supportive, neutral, and unsupportive stance classes on Facebook data, which is significantly better than models in which either user, topic, or comment information is withheld. This model design greatly mitigates the lack of data for the minor class without the use of oversampling. In addition, UTCNN yields a 0.842 accuracy on English online debate forum data, which also significantly outperforms results from previous work as well as other deep learning models, showing that UTCNN performs well regardless of language or platform.
研究动机与目标
- 为解决现有模型仅关注文本的局限性,通过整合用户、主题和评论信息,以提升立场分类性能。
- 开发一种统一的深度学习框架,利用用户互动、主题影响和评论内容进行帖子立场预测。
- 在不使用过采样技术的情况下,缓解少数立场类别中的数据不平衡问题。
- 在不同语言和平台(包括论坛和社会媒体)上评估模型性能。
- 证明学习得到的用户和主题嵌入在捕捉语义和关系模式方面对立场分类的有效性。
提出的方法
- UTCNN 使用深层神经网络架构,联合学习来自用户-帖子和用户-点赞互动的用户嵌入,即使对于活动极少的用户(例如仅有一条点赞或一条帖子)也能实现。
- 它引入主题模型为帖子分配主题,主题嵌入捕捉特定主题的立场倾向和词汇使用模式。
- 评论信息被视作额外的文本输入,通过卷积神经网络(CNN)处理,以提取与帖子立场相关的语义特征。
- 使用卷积神经网络(CNN)提取文本特征,以建模句子级别的语义和情感。
- 通过拼接和前馈网络将用户、主题和文本表征相结合,预测立场类别:支持、中立或不支持。
- 用户和主题嵌入与文本特征联合训练,使模型能够捕捉用户行为、主题上下文与帖子内容之间的相互依赖关系。
实验结果
研究问题
- RQ1整合用户、主题和评论信息是否能显著提升立场分类性能,超越仅依赖文本的模型?
- RQ2从极少用户活动(例如仅一条点赞)中学习到的用户嵌入,如何贡献于立场预测?
- RQ3主题建模在多大程度上提升了立场分类性能,特别是在处理特定主题的语言和立场倾向方面?
- RQ4UTCNN 是否能在不使用过采样技术的情况下,有效减少少数立场类别上的性能下降?
- RQ5与使用显式约束(如 ILP、CRF)或基于链接的建模(如 PSL)的模型相比,UTCNN 在准确率和泛化能力方面表现如何?
主要发现
- 在中文 Facebook 数据上,UTCNN 达到 0.755 的宏平均 F1 分数,显著优于排除用户、主题或评论信息的模型。
- 在英文 CreateDebate 数据上,UTCNN 达到 0.842 的准确率,该结果具有统计显著性(p < 0.001),并优于先前工作,包括 ILP、CRF 和 PSL 模型。
- 移除用户信息后,性能显著下降至 0.632 的准确率,表明用户嵌入是模型中最关键的组成部分。
- 主题信息使准确率提升 3.4%,表明主题特定上下文显著增强了分类性能。
- UTCNN 显著优于仅使用文本特征或传统 NLP 技术的模型,证明了联合表征学习的价值。
- 该模型在不依赖过采样技术的情况下,有效缓解了少数立场类别中的数据不平衡问题,各类别性能保持均衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。