[论文解读] Learning Twitter User Sentiments on Climate Change with Limited Labeled Data
本文提出了一种半监督机器学习方法,通过基于有影响力用户的新型标注技术,对Twitter用户关于气候变化的立场进行分类,在有限标注数据下实现了超过75%的准确率。研究发现,2018年飓风事件显著提升了同 cohort 用户对气候变化的积极情绪,而野火和暴风雪等其他灾害则未产生类似影响,表明情绪变化具有事件特异性,而非由自然灾害普遍驱动。
While it is well-documented that climate change accepters and deniers have become increasingly polarized in the United States over time, there has been no large-scale examination of whether these individuals are prone to changing their opinions as a result of natural external occurrences. On the sub-population of Twitter users, we examine whether climate change sentiment changes in response to five separate natural disasters occurring in the U.S. in 2018. We begin by showing that relevant tweets can be classified with over 75% accuracy as either accepting or denying climate change when using our methodology to compensate for limited labeled data; results are robust across several machine learning models and yield geographic-level results in line with prior research. We then apply RNNs to conduct a cohort-level analysis showing that the 2018 hurricanes yielded a statistically significant increase in average tweet sentiment affirming climate change. However, this effect does not hold for the 2018 blizzard and wildfires studied, implying that Twitter users' opinions on climate change are fairly ingrained on this subset of natural disasters.
研究动机与目标
- 解决在有限标注数据下,对Twitter上气候变化话语进行可扩展、无偏见的情感分析的不足。
- 开发一种利用有影响力用户生成高质量训练数据的标注方法,无需人工标注。
- 通过同 cohort 分析比较事件前后的感情状态,以减少由事件驱动的推文激增带来的偏差。
- 评估2018年特定自然灾害是否在Twitter上引发了公众对气候变化态度的可测量变化。
- 将总体平均情感趋势与同 cohort 情感变化进行比较,以评估情感分析中的方法偏差。
提出的方法
- 采用两阶段数据收集流程:首先收集133位有影响力Twitter用户(87位正面,46位负面)的推文,形成标注训练集。
- 将有影响力用户的推文按90/10比例划分为训练集和验证集,情感标签基于有影响力用户已知的立场。
- 应用基于RNN的模型,对2018年美国五起灾难事件(飓风、野火、暴风雪)的相关推文进行情感分类。
- 通过识别在每场灾难前后均发推的用户,实施同 cohort 分析,以减少选择偏差。
- 使用学生t检验评估在总体和同 cohort 比较中,事件前后情感变化的统计显著性。
- 对用户自报的位置进行地理编码,以进行空间分析,并验证模型在不同区域的鲁棒性。
实验结果
研究问题
- RQ12018年接触自然灾害是否会导致Twitter用户对气候变化的情感产生可测量的变化?
- RQ2总体情感趋势与同 cohort 情感变化在应对灾害时有何差异?
- RQ3情感变化在不同类型的灾害(如飓风与野火)之间是否一致?
- RQ4基于有影响力用户的半监督标注方法是否能在有限标注数据下实现高情感分类准确率?
- RQ5地理和人口因素在多大程度上调节灾难后的情感变化?
主要发现
- 所提出的标注方法在使用有限标注数据进行气候变化情感分类时,准确率超过75%,且在多种机器学习模型中均表现稳健。
- 飓风佛罗伦萨在同 cohort 用户中引发了统计显著的0.21分正向情感提升,表明事件后公众对气候变化的接受度提高。
- 飓风迈克尔同样在同 cohort 中引发显著的0.11分正向情感提升,逆转了事件前的负面情绪。
- 相比之下,门多西诺野火虽导致总体情感下降0.06分,但同 cohort 内正向情感提升了0.09分,表明用户行为模式复杂。
- 东海岸炸弹低气压事件仅引发微弱情感变化,总体仅上升0.02分,同 cohort 上升0.04分,表明对情感影响有限。
- 加州坎普野火导致同 cohort 内正向情感下降0.27分,主因是事件前推文量低,且事件后公众将火灾归因于电力公司,从而削弱了对气候变化的关联感知。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。