[论文解读] Team Phoenix at WASSA 2021: Emotion Analysis on News Stories with Pre-Trained Language Models
本文针对 WASSA 2021 共享任务中的新闻故事情感分析,提出了一种基于预训练语言模型的多任务学习方法。在第1赛道(共情与痛苦预测)中,作者采用参数共享和基于归一化人口统计特征的句子嵌入回归,取得了 0.417 的皮尔逊相关系数。在第2赛道(多维情感预测)中,他们证明通过微调 T5 模型进行条件生成的方法优于分类方法,取得了 0.502 的宏平均 F1 分数,在排行榜中位列第2名。
Emotion is fundamental to humanity. The ability to perceive, understand and respond to social interactions in a human-like manner is one of the most desired capabilities in artificial agents, particularly in social-media bots. Over the past few years, computational understanding and detection of emotional aspects in language have been vital in advancing human-computer interaction. The WASSA Shared Task 2021 released a dataset of news-stories across two tracks, Track-1 for Empathy and Distress Prediction and Track-2 for Multi-Dimension Emotion prediction at the essay-level. We describe our system entry for the WASSA 2021 Shared Task (for both Track-1 and Track-2), where we leveraged the information from Pre-trained language models for Track-specific Tasks. Our proposed models achieved an Average Pearson Score of 0.417 and a Macro-F1 Score of 0.502 in Track 1 and Track 2, respectively. In the Shared Task leaderboard, we secured 4th rank in Track 1 and 2nd rank in Track 2.
研究动机与目标
- 通过使用参数共享的预训练语言模型,提升新闻故事中文情感与痛苦预测的性能。
- 探究条件生成模型在小数据集上是否优于传统分类模型用于多维情感预测。
- 评估针对小数据集的情感分析任务,进行特定任务的增量微调的有效性。
- 探索将人口统计与人格特征整合以提升情感预测性能的方法。
提出的方法
- 在第1赛道中,系统采用在共情与痛苦预测头之间共享参数的多任务学习方法,利用句子嵌入和归一化的人口统计特征。
- 第1赛道的最终预测通过在拼接的句子嵌入与人口统计特征嵌入上使用多层感知机(MLP)进行回归完成。
- 在第2赛道中,方法将情感预测建模为使用微调后的 T5 和 Pegasus 模型的条件生成任务。
- 作者在预训练的 T5-base 模型上,使用特定任务的情感分类数据集进行增量微调,提升了基线模型的性能。
- 系统使用 Hugging Face 提供的预训练模型(包括 T5-base 和 BERT-base),通过迁移学习和消融实验比较不同架构的性能。
- 性能在开发集和保留的测试集上进行评估,第1赛道使用皮尔逊相关系数,第2赛道使用宏平均 F1 分数。
实验结果
研究问题
- RQ1在新闻故事情感分析任务中,共情与痛苦预测之间的参数共享是否能提升性能?
- RQ2在小数据集上,条件生成模型是否能优于传统分类模型用于多维情感预测?
- RQ3对预训练语言模型进行特定任务的增量微调是否能提升情感预测任务的性能?
- RQ4归一化的人口统计与人格特征在提升情感预测模型性能方面有多有效?
主要发现
- 第1赛道的最终提交结果在保留测试集上的平均皮尔逊相关系数为 0.417,在共享任务排行榜中位列第4名。
- 使用微调后的 T5-base 模型的第2赛道系统在开发集上取得了 0.572 的宏平均 F1 分数,优于 BERT-base(0.38)和 ALBERT-base-v2(0.4739)。
- 第2赛道的最终提交结果在测试集上取得了 0.502 的宏平均 F1 分数,在共享任务排行榜中位列第2名。
- 在第2赛道中,条件生成模型(如 T5 和 Pegasus)在情感预测任务中优于基于上下文嵌入的分类模型(如 BERT 和 ALBERT)。
- 对 T5 模型进行特定任务的增量微调显著提升了性能,微调后的版本达到 0.572 的宏平均 F1 分数,而基线 T5 模型仅为 0.5259。
- 消融实验表明,尽管 XGBoost 和 AdaBoost 等模型在验证集上表现强劲,但基于 MLP 的回归头在第1赛道的验证集上表现最佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。