[论文解读] BERT-based Ensembles for Modeling Disclosure and Support in Conversational Social Media Text
本文提出了一种基于 BERT 的集成模型,结合 RoBERTa 和 ALBERT,用于预测 CL-Aff 共享任务中 Reddit 评论的情感披露与支持性。该集成模型在 F1 分数上相比基线模型提升了 3%,而统计分析显示评论影响力与语言特征之间的相关性极低,表明在影响力预测中需要更先进的架构。
There is a growing interest in understanding how humans initiate and hold conversations. The affective understanding of conversations focuses on the problem of how speakers use emotions to react to a situation and to each other. In the CL-Aff Shared Task, the organizers released Get it #OffMyChest dataset, which contains Reddit comments from casual and confessional conversations, labeled for their disclosure and supportiveness characteristics. In this paper, we introduce a predictive ensemble model exploiting the finetuned contextualized word embeddings, RoBERTa and ALBERT. We show that our model outperforms the base models in all considered metrics, achieving an improvement of $3\%$ in the F1 score. We further conduct statistical analysis and outline deeper insights into the given dataset while providing a new characterization of impact for the dataset.
研究动机与目标
- 开发一种稳健的预测模型,用于识别对话式社交媒体文本中的情感与信息性披露及支持性。
- 通过利用基于上下文的 BERT 嵌入进行集成学习,提升在 CL-Aff 共享任务数据集上的性能。
- 分析数据集特征,如标签不平衡、词数以及时间模式(例如星期几),以揭示行为趋势。
- 引入“影响力”——定义为点赞数与点踩数之差——作为社交媒体对话中评论影响力的新型表征。
- 研究语义特征与评论影响力之间的关系,评估语言线索是否能预测传播性或参与度。
提出的方法
- 该模型采用两种预训练的 BERT 架构(RoBERTa 和 ALBERT)的集成,针对 Get it #OffMyChest 数据集进行微调,用于披露与支持性分类。
- 通过加权平均策略组合集成预测结果,以降低方差并提升在多个下游分类任务中的泛化能力。
- 应用迁移学习,使用 RoBERTa 和 ALBERT 的上下文嵌入,这些嵌入通过大规模语料库的掩码语言建模和下一句预测目标进行预训练。
- 使用皮尔逊积矩相关系数进行统计分析,以检验标签频率、评论特征(如词数、每帖评论数)与时间属性(如星期几)之间的关系。
- 影响力量化为点赞数与点踩数之差,并评估其与语言特征(如正面/负面词汇、主观词汇、词义相似性度量)的相关性。
- 利用 FastText 和基于 WordNet 的方法提取语义特征,包括 Sense Closest、Sense Farmost、Sense Combination 和 Positive Polarity Confidence,以评估其对评论影响力预测能力的影响。
实验结果
研究问题
- RQ1与单一 BERT 模型相比,RoBERTa 和 ALBERT 的集成在披露与支持性预测上的性能提升如何?
- RQ2Reddit 对话数据集中标签分布、词数及每帖或每用户评论频率的主导模式是什么?
- RQ3一周中的某一天是否显著影响忏悔类和非正式 Reddit 帖子中披露或支持性评论的频率?
- RQ4情感、主观性及词义相似性等语义特征在多大程度上能预测评论的社会影响力(点赞减去点踩)?
- RQ5‘影响力’是否是一种独特且有意义的评论影响力表征,其与现有标签或语义特征的相关性不强?
主要发现
- 所提出的基于 BERT 的集成模型相比基线模型在 F1 分数上提升了 3%,证明了使用上下文嵌入进行集成学习的有效性。
- 数据集表现出显著的标签不平衡,词数、每父帖评论数及用户层面活动存在较大差异。
- 在不同星期几之间未观察到披露或支持性评论频率的统计显著差异,表明不存在强烈的每周行为模式。
- 评论影响力与情感披露之间的皮尔逊相关系数为 0.046,是所有标签中最高者,表明存在微弱但明确的关系。
- 在语义特征中,Sense Closest 与影响力的皮尔逊相关系数最高(ρ = 0.040),而其他所有特征的相关系数接近零或略为负值,表明标准语言特征的预测能力有限。
- 影响力与语义特征之间的相关性极低,暗示评论影响力受复杂且非语言因素的影响,因此需要更复杂的模型才能实现准确预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。