[论文解读] "Sharks are not the threat humans are": Argument Component Segmentation in School Student Essays
本文提出了一种基于标记级别的分类方法,用于识别初中生作文中的主张和前提,避免了传统流水线分割方法。通过使用联合进行标记和句子分类的多任务BERT模型,相较于基于特征的方法,准确率提升了7.5%,显著改善了在学生写作中常见的复杂、连写及多主张句子上的表现。
Argument mining is often addressed by a pipeline method where segmentation of text into argumentative units is conducted first and proceeded by an argument component identification task. In this research, we apply a token-level classification to identify claim and premise tokens from a new corpus of argumentative essays written by middle school students. To this end, we compare a variety of state-of-the-art models such as discrete features and deep learning architectures (e.g., BiLSTM networks and BERT-based architectures) to identify the argument components. We demonstrate that a BERT-based multi-task learning architecture (i.e., token and sentence level classification) adaptively pretrained on a relevant unlabeled dataset obtains the best results
研究动机与目标
- 为解决在初中生作文中识别论点成分的挑战,此类作文常包含连写句子、一句多主张及缺乏支持的断言。
- 通过将论点分割与成分分类整合为单一的标记级别分类任务,克服流水线方法的局限性。
- 评估离散特征、BiLSTM和基于BERT的模型在识别学生写作中主张和前提方面的有效性。
- 探究在复杂、非标准写作中,使用句子级别监督的多任务学习是否能提升标记级别分类的表现。
- 发布一个包含145篇初中生议论文的新标注语料库,以供未来教育领域论点挖掘研究使用。
提出的方法
- 采用BIO标注格式的标记级别序列分类框架,对主张(B-Claim,I-Claim)和前提(B-Premise,I-Premise)进行标注。
- 对比三种建模方法:基于手工特征的CRF、BiLSTM以及基于BERT的模型,包括微调和多任务变体。
- 实施多任务学习目标,使模型同时预测标记级别的论点成分和句子级别的论点存在性(二分类)。
- 在训练过程中使用基于不确定性的损失加权方法,以平衡主要的标记分类任务和辅助的句子分类任务。
- 在微调前,先在相关未标注数据集上对BERT模型进行自适应预训练。
- 对失败案例进行定性分析,重点关注连写句子、一句多主张及诸如“though”或“because”等话语标记。
实验结果
研究问题
- RQ1联合进行标记和句子分类的方法是否能在识别初中生作文中论点成分方面优于传统流水线方法?
- RQ2不同架构——离散特征、BiLSTM和BERT——在学生写作的论点成分分割任务中表现如何?
- RQ3在复杂、非标准写作中,使用句子级别监督的多任务学习在多大程度上提升了主张和前提的识别效果?
- RQ4模型的主要失败模式是什么,特别是针对连写句子和单句中多个主张的情况?
- RQ5话语标记如“though”或“because”如何影响模型预测?模型能否正确区分这些标记与主张边界?
主要发现
- 多任务BERT模型表现最佳,相较于表现最好的基于离散特征的CRF模型,准确率提升了7.5个百分点。
- 多任务模型成功识别出单任务模型遗漏的主张,例如在复杂句子中识别出主张“[many more negative effects that come with social media…]”。
- 多任务模型通过正确将非论点性句子(如“internet’s social networks help teens find communities”)和意见性陈述分类为非主张,减少了误报。
- 模型在包含多个主张的连写句子上表现不佳,常将多个主张合并为一个主张,或在逗号后误将“each”等词作为主张起始点。
- 模型频繁将“though”或“because”等话语标记误分类为主张起始点,表明其在利用此类标记作为主张分隔符方面存在困难。
- 分析显示,当逗号后紧随一个名词时,模型倾向于过度预测主张;而当逗号后是副词如“only”时,模型能正确识别主张,表明其对句法线索的处理存在不一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。