[论文解读] Tweet Acts: A Speech Act Classifier for Twitter
本文提出了一种基于自定义六类话语类型(断言、表达、问题、请求、建议和杂项)的监督式微博话语行为分类器,利用语义和句法特征进行建模。在7,563条人工标注的微博数据上进行训练,逻辑回归模型达到了0.70的SOTA平均F1分数,其中基于主题的分类器优于微博全量和类型特定的变体。
Speech acts are a way to conceptualize speech as action. This holds true for communication on any platform, including social media platforms such as Twitter. In this paper, we explored speech act recognition on Twitter by treating it as a multi-class classification problem. We created a taxonomy of six speech acts for Twitter and proposed a set of semantic and syntactic features. We trained and tested a logistic regression classifier using a data set of manually labelled tweets. Our method achieved a state-of-the-art performance with an average F1 score of more than $0.70$. We also explored classifiers with three different granularities (Twitter-wide, type-specific and topic-specific) in order to find the right balance between generalization and overfitting for our task.
研究动机与目标
- 开发一种监督式微博话语行为分类器,以捕捉微博背后的语用意图,超越字面内容,理解交际目的。
- 构建一个适用于微博非正式、嘈杂且依赖上下文的语言使用场景的六类话语行为分类体系。
- 识别并评估在短文本、公开社交媒体文本中预测话语行为的语义和句法特征。
- 在三种粒度(微博全量、类型特定、主题特定)下比较分类器性能,以平衡泛化能力与过拟合问题。
- 通过准确识别微博中的用户意图,提升谣言检测和情感分析等下游应用的性能。
提出的方法
- 基于Searle的话语行为理论和微博特定使用模式,构建了六类话语行为类型:断言、表达、问题、请求、建议和杂项。
- 在六个主题(每类主题下两个子类:面向实体、面向事件、长期性)中收集了7,563条人工标注的微博,标注者间一致性Cohen’s kappa = 0.78。
- 提取了3,313个二值特征,结合语义线索(如情感、情态、情绪词、否定词)和句法线索(如词性标注、感叹词存在性、形容词使用)。
- 使用20折交叉验证,在五种分类器(朴素贝叶斯、决策树、SVM、逻辑回归和基线最大分类器)上进行训练与评估,覆盖三种粒度。
- 比较完整特征集与语义和句法特征子集的性能,以评估各模态的贡献。
- 采用与Zhang等人相同的评估协议,将最终模型(TweetAct)与先前SOTA分类器进行基准对比。
实验结果
研究问题
- RQ1微博交流中最具代表性且具有区分度的话语行为类别是什么?如何为计算分析正式分类?
- RQ2在短篇、非正式的微博文本中,哪些语义和句法特征最能预测特定话语行为?
- RQ3在建模话语行为时,分类器性能在不同粒度层次(微博全量、类型特定、主题特定)下如何变化?
- RQ4语义和句法特征在话语行为分类性能中各自独立的贡献程度如何?
- RQ5监督式话语行为分类器能否在识别微博用户意图方面超越现有方法,特别是在谣言检测等应用中?
主要发现
- 逻辑回归分类器在微博全量设置下,对全部六类话语行为的平均F1分数达到SOTA的0.70。
- 主题特定分类器优于微博全量和类型特定分类器,平均F1分数达到0.74,表明主题特定上下文可提升分类准确率。
- 语义与句法特征联合使用表现最佳,完整模型显著优于仅使用单一特征类型的方法。
- 语义特征在分类表达和问题类话语行为中贡献显著;句法特征(尤其是感叹词和形容词)对表达和建议类话语行为具有高度预测性。
- TweetAct分类器在所有六类话语行为中均优于Zhang等人提出的先前SOTA分类器,各类别F1分数均更高。
- 模型对问题类(F1 = 0.87)和表达类(F1 = 0.80)的性能最为稳健,而请求类(F1 = 0.30)和建议类(F1 = 0.16)仍是最具挑战性的类别。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。