[论文解读] Transgender Community Sentiment Analysis from Social Media Data: A Natural Language Processing Approach
本研究开发了一套用于分析跨性别者社交媒体帖子情感倾向的自然语言处理(NLP)框架,基于人工标注的300条Reddit评论数据集,评估了多种机器学习与深度学习模型。其中LSTM模型表现最佳(准确率:0.852,AUC:0.876),表明通过自动化情感检测实现早期心理健康干预具有强大潜力。
Transgender community is experiencing a huge disparity in mental health conditions compared with the general population. Interpreting the social medial data posted by transgender people may help us understand the sentiments of these sexual minority groups better and apply early interventions. In this study, we manually categorize 300 social media comments posted by transgender people to the sentiment of negative, positive, and neutral. 5 machine learning algorithms and 2 deep neural networks are adopted to build sentiment analysis classifiers based on the annotated data. Results show that our annotations are reliable with a high Cohen's Kappa score over 0.8 across all three classes. LSTM model yields an optimal performance of accuracy over 0.85 and AUC of 0.876. Our next step will focus on using advanced natural language processing algorithms on a larger annotated dataset.
研究动机与目标
- 将来自跨性别社区的300条Reddit评论人工标注为积极、消极或中性情感类别。
- 评估多种机器学习与深度学习模型在从社交媒体文本中分类跨性别社区情感方面的性能。
- 开发一种自动化情感分类器,能够检测跨性别者在线表达中的心理健康相关困扰,以实现早期干预。
- 为未来关于跨性别心理健康的人工智能研究建立一个可靠且高一致性的数据集。
提出的方法
- 从/r/asktransgender板块收集的300条Reddit评论由两名标注员人工标注,分歧由第三人裁定,所有类别间Cohen’s Kappa值均超过0.8。
- 在标注数据上训练了五种传统机器学习模型(朴素贝叶斯、逻辑回归、随机森林、支持向量机、K近邻)和两种深度学习模型(卷积神经网络与长短期记忆网络)。
- 使用在大规模社交媒体数据上预训练的Word2Vec词嵌入表示深度学习模型的文本输入。
- LSTM模型采用三层堆叠结构,神经元数分别为128、64和32,使用ReLU激活函数、Dropout(0.2)和全局最大池化;优化器采用Adam,损失函数为二元交叉熵。
- 模型评估采用20%保留的测试集计算准确率与宏平均AUC;传统模型采用5折交叉验证,10%训练数据用作超参数调优的验证集。
- 所有模型使用Python 3.6实现,深度学习部分基于Keras,传统模型基于scikit-learn,训练过程在单张GPU上加速。
实验结果
研究问题
- RQ1人工标注的跨性别社交媒体评论数据集能否在情感分类任务中实现高评分者间一致性?
- RQ2在分类跨性别社区社交媒体内容情感方面,哪些机器学习与深度学习模型表现最佳?
- RQ3自动化情感分类器能否以高准确率与AUC值检测出跨性别者在线表达中的负面情绪?
- RQ4在本研究语境下,'dysphoria'或'question'等关键词如何影响情感分类?
主要发现
- 人工标注过程在所有三类情感中均获得Cohen’s Kappa值高于0.8,表明评分者间具有极高的可靠性。
- LSTM模型达到最高准确率0.852与最佳AUC值0.876,优于所有其他测试模型。
- CNN模型准确率位列第二(0.861),略高于LSTM,但在AUC上表现不及LSTM。
- 所有深度学习模型(CNN与LSTM)在准确率与AUC上均优于所有传统机器学习分类器。
- 词云可视化识别出'转性'、'跨性别'、'dysphoria'、'question'与'wondering'为对情感分类最具影响力的关键词。
- 本研究证明,对跨性别社交媒体数据进行自动化情感分析,可支持心理健康困扰的早期识别,并为及时干预提供依据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。