[论文解读] WASSA@IITK at WASSA 2021: Multi-task Learning and Transformer Finetuning for Emotion Classification and Empathy Prediction
本论文针对 WASSA 2021 共享任务中的情感分类与同理心预测问题,提出了一种基于 ELECTRA 和 RoBERTa 的多任务学习与微调方法。通过迁移学习、使用 GoEmotions 数据集进行数据增强以及集成方法,该系统在情感分类任务中取得了 0.5528 的宏平均 F1 分数(排名第一),在同理心预测任务中取得了 0.533 的皮尔逊相关系数(排名第三)。
This paper describes our contribution to the WASSA 2021 shared task on Empathy Prediction and Emotion Classification. The broad goal of this task was to model an empathy score, a distress score and the overall level of emotion of an essay written in response to a newspaper article associated with harm to someone. We have used the ELECTRA model abundantly and also advanced deep learning approaches like multi-task learning. Additionally, we also leveraged standard machine learning techniques like ensembling. Our system achieves a Pearson Correlation Coefficient of 0.533 on sub-task I and a macro F1 score of 0.5528 on sub-task II. We ranked 1st in Emotion Classification sub-task and 3rd in Empathy Prediction sub-task
研究动机与目标
- 为应对在伤害相关新闻文章回应作文中建模同理心与情感的挑战。
- 通过预训练的 Transformer 模型提升低资源情感分类与同理心预测任务的性能。
- 探究多任务学习与数据增强在提升模型泛化能力与减少偏差方面的有效性。
- 利用深度学习开发一个能够同时预测作文层面同理心与痛苦程度得分的鲁棒系统。
- 评估模型初始化敏感性与集成策略对性能稳定性与准确性的影响力。
提出的方法
- 端到端微调 ELECTRA-large 与 RoBERTa-large 模型,为回归(同理心/痛苦程度)与分类(情感)任务分别添加单一前馈层。
- 通过共享 ELECTRA 编码器并为同理心与痛苦程度预测分别使用独立的前馈头,实现多任务学习,联合优化使用均方误差(MSE)损失。
- 利用 GoEmotions 数据集进行数据增强,以平衡情感分类任务中的类别分布,尤其改善了低频类别的表现。
- 通过多个训练模型预测结果的简单平均实现模型集成,以提升泛化能力并降低方差。
- 使用 AdamW 优化器,初始学习率设为 1e-5,权重衰减,并在单张 Tesla V100 GPU 上通过 Google Colab 进行训练,批量大小为 8 或 16。
- 通过多次使用不同的随机种子训练模型,以缓解因权重初始化敏感性导致的性能波动。
实验结果
研究问题
- RQ1使用共享 Transformer 编码器的多任务学习是否能提升同理心预测与情感分类任务的性能?
- RQ2使用 GoEmotions 数据集进行数据增强在提升低资源情感分类任务的泛化能力与减少偏差方面有多有效?
- RQ3模型集成在多大程度上能降低方差并提升微调后 Transformer 模型的性能稳定性?
- RQ4微调后的 ELECTRA 与 RoBERTa 模型对权重初始化的敏感性如何?是否可通过集成策略缓解此问题?
- RQ5使用 ELECTRA 与 RoBERTa 等预训练模型对低资源情感计算任务(如同理心与情感预测)有何影响?
主要发现
- ELECTRA 与 RoBERTa 模型的集成在情感分类测试集上取得了 0.5528 的宏平均 F1 分数,位列共享任务第一名。
- 最终系统在同理心预测子任务中取得了 0.533 的皮尔逊相关系数,位列所有提交结果中的第三名。
- 使用 GoEmotions 进行数据增强显著提升了模型性能,尤其减少了对愤怒情绪的过度预测,并增强了低频类别的识别能力。
- 模型性能对初始化高度敏感,不同随机种子下的验证分数存在显著差异,凸显了集成方法的必要性。
- 混淆矩阵显示,数据增强后对恐惧类别的识别表现强劲,且各类别间分布更加均衡,尤其减少了将喜悦误分类为愤怒的情况。
- 为每个任务(同理心与痛苦程度)集成两个模型,相比单个模型,显著提升了泛化能力,改善了相关系数与 F1 分数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。