[论文解读] Learning from various labeling strategies for suicide-related messages on social media: An experimental study
本研究探讨了不同标注策略——使用众包工作者和领域专家——对检测社交媒体上与自杀相关的内容的监督式机器学习模型性能的影响。通过比较不同的标签聚合方法,作者发现,基于众包工作者和专家标注者一致同意的标签训练模型,可获得最稳健且准确的结果,尤其在主观性强、风险高的领域(如自杀风险检测)中表现更优。
Suicide is an important but often misunderstood problem, one that researchers are now seeking to better understand through social media. Due in large part to the fuzzy nature of what constitutes suicidal risks, most supervised approaches for learning to automatically detect suicide-related activity in social media require a great deal of human labor to train. However, humans themselves have diverse or conflicting views on what constitutes suicidal thoughts. So how to obtain reliable gold standard labels is fundamentally challenging and, we hypothesize, depends largely on what is asked of the annotators and what slice of the data they label. We conducted multiple rounds of data labeling and collected annotations from crowdsourcing workers and domain experts. We aggregated the resulting labels in various ways to train a series of supervised models. Our preliminary evaluations show that using unanimously agreed labels from multiple annotators is helpful to achieve robust machine models.
研究动机与目标
- 探究不同标注策略如何影响监督式模型在检测社交媒体上与自杀相关的内容时的性能。
- 评估结合众包工作者和领域专家在标注主观性心理健康内容方面的可靠性和有效性。
- 确定将多个标注聚合为金标准训练数据的最佳方法,用于与自杀相关的语篇。
- 评估高标注者间一致性是否能带来更稳健且可泛化的机器学习模型。
- 为构建高质量社交媒体自杀风险检测训练语料库提供基于证据的指导。
提出的方法
- 对通过关键词和地理位置查询收集的与自杀相关推文,开展了多轮标注,标注者包括众包工作者和领域专家。
- 第一轮收集众包工作者的标注,随后对标注者间一致性较低的样本进行专家评审。
- 采用多种策略聚合标签:多数投票、众包工作者的一致同意、专家的一致同意,以及两组一致同意标签的合并。
- 使用从这些聚合策略中衍生的不同训练数据子集,训练了五种不同的监督式模型(C1 至 C5)。
- 使用标准指标评估模型性能,包括精确率、召回率、F1分数、ROC AUC 和平均精确率,通过加权F1处理类别不平衡问题。
- 通过最佳性能分类器(C4)的模型系数识别出最具区分性的特征,揭示了与自杀意念相关的语言标记。
实验结果
研究问题
- RQ1标签聚合策略的选择(多数投票 vs. 一致同意)如何影响与自杀相关的内容检测模型的性能?
- RQ2当实现高标注者间一致性时,众包工作者能否为与自杀相关的内容提供可靠的标注?
- RQ3在模糊案例中引入专家标注是否能提升模型的鲁棒性,相较于仅依赖众包标注?
- RQ4不同的训练数据构建方法如何影响模型在F1和AUC等关键指标上的泛化能力和性能?
- RQ5哪些语言特征最能预测社交媒体上的与自杀相关的内容?这些特征在不同标注策略下有何差异?
主要发现
- 在由众包工作者和专家一致标注的数据上训练的模型(C4)在所有指标上均表现最佳,包括F1分数、精确率、召回率和ROC AUC。
- 仅在众包工作者一致同意标签上训练的模型(C3)表现几乎与C4相当,表明非专家间高度一致的标注可产生可靠的训练数据。
- 在标注者间一致性较低的数据上训练的模型(如C1和C5)性能显著更差,尤其在精确率和F1分数上,凸显了噪声标签的负面影响。
- 在最小数据集上训练的模型——仅使用12个来自专家一致标注的正样本(C2)——精确率、召回率和F1分数均为零,凸显了高质量数据充足性的重要性。
- 最佳性能模型(C4)识别出的顶级特征包括“depression”、“suicide”、“kill myself”和“commit suicide”等术语,与已知的自杀意念语言标记一致。
- 研究发现,仅使用多数票标签或混合一致性标签会导致模型稳定性更低、准确性更差,表明低一致性标签会引入噪声,从而降低模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。