[论文解读] Learning Word Ratings for Empathy and Distress from Document-Level User Responses
本论文通过使用混合层级前馈网络(MLFFN)从文档级用户反馈中学习词级评分,首次构建了情感共情与痛苦的词典,其性能优于现有方法。该方法通过反演训练好的神经网络,推导出词级共情与痛苦评分,从而实现可解释性、鲁棒性,并公开提供适用于心理学与自然语言处理应用的词典。
Despite the excellent performance of black box approaches to modeling sentiment and emotion, lexica (sets of informative words and associated weights) that characterize different emotions are indispensable to the NLP community because they allow for interpretable and robust predictions. Emotion analysis of text is increasing in popularity in NLP; however, manually creating lexica for psychological constructs such as empathy has proven difficult. This paper automatically creates empathy word ratings from document-level ratings. The underlying problem of learning word ratings from higher-level supervision has to date only been addressed in an ad hoc fashion and has not used deep learning methods. We systematically compare a number of approaches to learning word ratings from higher-level supervision against a Mixed-Level Feed Forward Network (MLFFN), which we find performs best, and use the MLFFN to create the first-ever empathy lexicon. We then use Signed Spectral Clustering to gain insights into the resulting words. The empathy and distress lexica are publicly available at: http://www.wwbp.org/lexica.html.
研究动机与目标
- 为解决自然语言处理中缺乏可解释性、鲁棒的共情与痛苦词典的问题,尽管这些概念日益受到关注。
- 克服因共情与自我关注型痛苦之间语义模糊而难以人工构建共情词典的困难。
- 开发一种系统性方法,利用深度学习从更高层级(文档级)监督信号中学习词级评分。
- 利用新颖的神经网络反演方法,创建首个公开可用的共情与痛苦词典。
- 使用符号谱聚类分析所得词典,以揭示共情语言中的语义模式。
提出的方法
- 训练混合层级前馈网络(MLFFN)以从词级特征预测文档级共情与痛苦评分。
- 通过从文档级输出反向传播至词级输入,反演训练好的MLFFN模型,推导出词级评分。
- 采用监督学习设置,使用共情反应数据集,基于文档级共情与痛苦评分训练模型。
- 对学习到的词级评分应用符号谱聚类,识别高/低共情/痛苦词语的语义聚类。
- 人工标注聚类,以估算词典中命名实体(如人物、组织)的比例。
- 将MLFFN性能与其它基线方法(包括线性模型与自编码器)在词级评分学习上的表现进行比较。
实验结果
研究问题
- RQ1深度学习模型能否有效从文档级用户反馈中学习词级共情与痛苦评分?
- RQ2MLFFN模型在从高层监督中学习词级评分方面,相较于现有临时性或非深度学习方法表现如何?
- RQ3基于学习到的共情与痛苦评分聚类词语时,会浮现何种语义模式?
- RQ4命名实体(如人物、组织)在最终共情与痛苦词典中所占比例有多大?
- RQ5所得词典在心理学与自然语言处理应用中的可解释性与鲁棒性如何?
主要发现
- MLFFN模型在从文档级监督中学习词级共情与痛苦评分方面,显著优于其他方法,包括线性模型与自编码器。
- 所得共情与痛苦词典已公开发布于 http://www.wwbp.org/lexica.html,可供NLP与心理学研究使用。
- 符号谱聚类揭示了有意义的语义分组,例如与共情关怀相关的词语簇(如:富有同情心、温柔)与个人痛苦相关的词语簇(如:焦虑、不堪重负)。
- 约6%的词典条目为命名实体,其中组织与人物最为常见,表明与共情相关的语言常涉及具体个人或群体。
- 该方法成功反演神经网络,推导出可靠的词级评分,证明深度学习可用于创建可解释性、领域特定的词典。
- 本研究验证了词级评分在提升模型可解释性方面的实用性,并支持未来与SHAP等可解释性工具集成,以实现更深入的模型分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。