[论文解读] Data Augmentation for Improving Emotion Recognition in Software Engineering Communication
本文提出基于极性的数据增强方法,以提升软件工程沟通中的情感识别性能,利用基于 BART 的文本生成技术创建保留情感极性的合成训练数据。该方法在三个现有情感分类器(ESEM-E、EMTk、SEntiMoji)上平均提升了 9.3% 的微 F1 分数,显著改善了 GitHub 问题和拉取请求评论中的情感识别性能。
Emotions (e.g., Joy, Anger) are prevalent in daily software engineering (SE) activities, and are known to be significant indicators of work productivity (e.g., bug fixing efficiency). Recent studies have shown that directly applying general purpose emotion classification tools to SE corpora is not effective. Even within the SE domain, tool performance degrades significantly when trained on one communication channel and evaluated on another (e.g, StackOverflow vs. GitHub comments). Retraining a tool with channel-specific data takes significant effort since manually annotating large datasets of ground truth data is expensive. In this paper, we address this data scarcity problem by automatically creating new training data using a data augmentation technique. Based on an analysis of the types of errors made by popular SE-specific emotion recognition tools, we specifically target our data augmentation strategy in order to improve the performance of emotion recognition. Our results show an average improvement of 9.3% in micro F1-Score for three existing emotion classification tools (ESEM-E, EMTk, SEntiMoji) when trained with our best augmentation strategy.
研究动机与目标
- 解决通用情感分类器在软件工程(SE)沟通中表现不佳的问题,原因在于领域特定语言和标注数据有限。
- 通过在新整理的 GitHub 数据集上进行错误分析,探究现有 SE 情感识别工具误分类的根本原因。
- 开发并评估针对 SE 文本定制的数据增强策略,以在无需大量人工标注的情况下提升模型泛化能力和性能。
- 证明聚焦于情感极性(而非广泛词汇替换)的增强方法,能最有效地提升情感分类性能。
- 提供一种可扩展、自动化的解决方案,以应对 SE 情感识别中的数据稀缺问题,从而支持开发者福祉和团队生产力分析的更好工具。
提出的方法
- 整理了一个包含 2,000 条 GitHub 问题和拉取请求评论的新数据集,使用六种主要情感(Shaver et al., 1987)和 GoEmotions 中的次级/三级类别进行标注。
- 对三种现有工具(ESEM-E、EMTk、SEntiMoji)的预测结果进行错误分析,识别出误分类模式,发现词汇线索识别失败是错误的主要原因。
- 设计了三种数据增强策略:无约束的随机词语替换、基于情感极性的约束替换,以及使用词典进行情感特定的词语替换。
- 利用 BART 语言模型进行上下文感知的文本生成,确保增强样本在语义连贯性和情感一致性方面保持稳定。
- 将增强技术应用于将训练数据规模扩大 10 倍,随后在增强后的数据上微调三种情感分类器,以评估性能提升。
- 采用分层的 80%-20% 训练-测试划分,并以微 F1 分数为主要评估指标,且标注的组间一致性 >0.8,以确保标注可靠性。
实验结果
研究问题
- RQ1现有情感分类器(ESEM-E、EMTk、SEntiMoji)在检测 GitHub 评论中的情感时效果如何,最常见的错误类型是什么?
- RQ2当前 SE 情感识别工具中误分类的主要原因是什么,特别是与词汇线索和情感极性相关的问题?
- RQ3数据增强技术能否提升现有 SE 通信中情感分类器的性能,哪种增强策略效果最佳?
- RQ4聚焦于情感极性的增强方法——即针对正向/负向情感词进行替换——是否优于通用或情感特定的增强策略,从而在 F1 分数上取得更好结果?
主要发现
- 三种现有情感分类器(ESEM-E、EMTk、SEntiMoji)在 GitHub 评论上的表现显著低于其原始评估数据集,表明存在领域偏移问题。
- 错误分析显示,大多数误分类源于工具无法识别明确的情感词汇线索,而非隐含或复杂的情感表达。
- 基于情感极性的数据增强方法——即用同种情感极性的同义词替换(如用正向词替换 Joy,用负向词替换 Anger)——带来了最高的性能提升。
- 该方法在所有三种工具上平均提升了 9.3% 的微 F1 分数,表明针对性增强优于通用或情感特定的方法。
- 表现最佳的增强策略并未依赖大规模 SE 领域特定的情感词典,表明通过预训练模型(如 BART)进行极性感知生成已足够有效且可扩展。
- 结果表明,数据增强能够有效缓解 SE 情感识别中的数据稀缺和领域偏移问题,为改进现有工具提供了切实可行的路径,而无需从头开始重新训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。