[论文解读] Creating a Domain-diverse Corpus for Theory-based Argument Quality Assessment
本论文提出了GAQCorpus,这是首个大规模、跨领域的英语论辩语料库,包含5,285个论辩,其论辩质量(AQ)依据四种理论维度(说服力、有效性、合理性及整体质量)进行了标注。作者通过专家协作简化标注指南,将理论驱动的AQ分类体系适配于众包标注,实现了高一致性的标注结果,从而在辩论、社区问答论坛和产品评论等非标准领域实现了可靠且可扩展的标注。
Computational models of argument quality (AQ) have focused primarily on assessing the overall quality or just one specific characteristic of an argument, such as its convincingness or its clarity. However, previous work has claimed that assessment based on theoretical dimensions of argumentation could benefit writers, but developing such models has been limited by the lack of annotated data. In this work, we describe GAQCorpus, the first large, domain-diverse annotated corpus of theory-based AQ. We discuss how we designed the annotation task to reliably collect a large number of judgments with crowdsourcing, formulating theory-based guidelines that helped make subjective judgments of AQ more objective. We demonstrate how to identify arguments and adapt the annotation task for three diverse domains. Our work will inform research on theory-based argumentation annotation and enable the creation of more diverse corpora to support computational AQ assessment.
研究动机与目标
- 解决缺乏大规模、跨领域理论驱动论辩质量(AQ)评估语料库的问题。
- 实现在网络辩论、社区问答和产品评论等非标准领域中可靠且可扩展的AQ标注。
- 在保持理论一致性的前提下,简化并适配复杂、理论基础坚实的AQ分类体系,以供众包工作者使用。
- 证明在众包环境中,基于理论的AQ标注可实现高一致性。
- 为未来计算论辩质量评估及写作支持系统的研究奠定基础。
提出的方法
- 基于论证理论构建了理论驱动的AQ分类体系,涵盖说服力、有效性、合理性及整体质量四个维度。
- 与受训的语言学家合作,简化众包工作者的标注指南与任务设计,在确保理论一致性的同时提升清晰度与可靠性。
- 从三个不同领域收集论辩:网络辩论、社区问答论坛(CQA)和产品评论。
- 采用多阶段标注流程,包括专家校准、指南迭代优化以及带质量控制的众包标注。
- 使用组间一致性度量指标(如Fleiss’ kappa)验证不同领域与维度下标注结果的可靠性。
- 通过GitHub公开发布最终语料库GAQCorpus,供研究使用。
实验结果
研究问题
- RQ1能否在非标准、跨领域环境中,通过众包方式可靠地收集基于理论的论辩质量标注?
- RQ2如何在不损失理论完整性的前提下,简化复杂、理论基础坚实的AQ分类体系以适应众包工作者?
- RQ3专家与众包工作者在多维AQ标注上的一致性水平如何?
- RQ4论辩质量判断在辩论、问答和评论等不同领域中是否存在差异?
- RQ5低分论辩在推理、结构或相关性方面是否表现出共同的缺陷?
主要发现
- GAQCorpus包含5,285个论辩,按四种理论驱动的AQ维度进行标注,是目前最大且唯一跨领域的同类语料库。
- 专家与众包工作者之间的组间一致性高于以往研究,Fleiss’ kappa值表明标注结果具有显著可靠性。
- 尽管论辩风格与结构各异,该标注流程在辩论、CQA论坛和产品评论等不同领域中均实现了高度一致性。
- 各领域中低分论辩普遍表现出缺乏对反论点的回应、使用无关的个人轶事或缺乏依据的断言等缺陷。
- 语料库显示,合理性维度对语气和伦理考量尤为敏感,使用玩笑或指责性语言会显著降低评分。
- 本研究证明,只要基于专家验证的简化指南,理论驱动的AQ标注可在大规模场景下实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。