Skip to main content
QUICK REVIEW

[论文解读] CruzAffect at AffCon 2019 Shared Task: A feature-rich approach to characterize happiness

Jiaqi Wu, Ryan Compton|arXiv (Cornell University)|Feb 16, 2019
Mental Health via Writing参考文献 12被引用 3
一句话总结

本文提出CruzAffect,一种基于监督与半监督学习的丰富特征系统,用于对HappyDB数据集中文本片段中的幸福感进行分类。该系统结合句法、情感、用户资料及词嵌入特征,与XGBoost和CNN模型结合,在二分类(主动性、社交性)和多分类(概念)情感分类任务中均取得优异性能,且各类别间共享的语言模式表明其具备构建幸福感建模的可泛化特征。

ABSTRACT

We present our system, CruzAffect, for the CL-Aff Shared Task 2019. CruzAffect consists of several types of robust and efficient models for affective classification tasks. We utilize both traditional classifiers, such as XGBoosted Forest, as well as a deep learning Convolutional Neural Networks (CNN) classifier. We explore rich feature sets such as syntactic features, emotional features, and profile features, and utilize several sentiment lexicons, to discover essential indicators of social involvement and control that a subject might exercise in their happy moments, as described in textual snippets from the HappyDB database. The data comes with a labeled set (10K), and a larger unlabeled set (70K). We therefore use supervised methods on the 10K dataset, and a bootstrapped semi-supervised approach for the 70K. We evaluate these models for binary classification of agency and social labels (Task 1), as well as multi-class prediction for concepts labels (Task 2). We obtain promising results on the held-out data, suggesting that the proposed feature sets effectively represent the data for affective classification tasks. We also build concepts models that discover general themes recurring in happy moments. Our results indicate that generic characteristics are shared between the classes of agency, social and concepts, suggesting it should be possible to build general models for affective classification tasks.

研究动机与目标

  • 识别区分幸福感在不同幸福感维度中的通用语言与情感特征。
  • 评估句法、情感、用户资料及嵌入等多种特征类型在幸福感相关文本情感分类中的有效性。
  • 探究在二分类标签(主动性、社交性)上训练的模型是否能有效泛化至多分类概念预测任务。
  • 研究句法模式与词典在捕捉幸福感心理构念中的作用。
  • 开发一种半监督框架,利用7万条未标注样本,提升对1万条标注数据集的泛化能力。

提出的方法

  • 采用三步引导的半监督学习流程,利用HappyDB中的标注数据(1万条)与未标注数据(7万条)。
  • 通过词性标注提取36种句法特征,包括词性、时态、体、疑问句结构等。
  • 整合来自LIWC v2007、EmoLex、主观性词典及自定义情感-事实回归模型的94种情感特征。
  • 使用100维GloVe词嵌入实现文本的分布式语义表征。
  • 将稀疏的用户资料特征(如国家、年龄)转换为基于语言的类别,以降低稀疏性并提升泛化能力。
  • 在组合特征集上训练XGBoost森林与CNN分类器,并采用10折交叉验证进行评估。

实验结果

研究问题

  • RQ1句法与情感特征在预测幸福感相关标签方面是否优于或补充词嵌入?
  • RQ2用户资料特征能否提升情感分类性能?若能,其粒度应如何设定?
  • RQ3在二分类标签(主动性、社交性)上训练的模型是否能有效泛化至多分类概念预测?
  • RQ4哪些句法模式可有效区分幸福感时刻中的‘家庭’、‘职业’或‘宗教’等概念?
  • RQ5在主动性、社交性与概念三类任务中,是否存在共享的语言与情感特征,以支持可泛化的感情分类模型?

主要发现

  • 句法与情感特征具有高度信息量,通常优于词嵌入,尤其在捕捉幸福感的上下文特定标记方面表现突出。
  • 用户资料特征单独预测能力有限,但与其他特征结合后略有提升,表明人口统计背景并非实现高性能的关键因素。
  • XGBoost森林与CNN模型均表现优异,其中XGBoost在二分类任务中表现更佳,而CNN在多分类概念预测与半监督学习中表现强劲。
  • ‘家庭’、‘职业’与‘购物’等概念的最常见句法模式具有显著差异且具备预测性,其模式多样性高、标准差低,表明存在稳定且一致的语言标记。
  • ‘宗教’与‘科技’表现出高模式多样性与频率,但‘宗教’拥有更多典型、高频的模式(如‘WENT TO’),表明其具有更强的可区分性。
  • 主动性、社交性与概念任务之间共享的语言模式——尤其是句法结构与情感词典使用——表明通用的组合特征可作为可泛化情感分类模型的基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。