Skip to main content
QUICK REVIEW

[论文解读] Automatic Argument Quality Assessment -- New Datasets and Methods

Assaf Toledo, Shai Gretz|arXiv (Cornell University)|Sep 3, 2019
Software Engineering Research参考文献 24被引用 6
一句话总结

本文引入了一个新的大规模数据集,包含6.3万个主动收集并明确标注的论点用于质量评估,以及14,000对成对比较,以提升自动论点质量评估的性能。该研究提出了基于BERT的神经网络模型,在论点对分类任务中达到最先进水平,并在论点排序任务中取得具有竞争力的结果,尽管该任务具有主观性,但标注的一致性水平很高。

ABSTRACT

We explore the task of automatic assessment of argument quality. To that end, we actively collected 6.3k arguments, more than a factor of five compared to previously examined data. Each argument was explicitly and carefully annotated for its quality. In addition, 14k pairs of arguments were annotated independently, identifying the higher quality argument in each pair. In spite of the inherent subjective nature of the task, both annotation schemes led to surprisingly consistent results. We release the labeled datasets to the community. Furthermore, we suggest neural methods based on a recently released language model, for argument ranking as well as for argument-pair classification. In the former task, our results are comparable to state-of-the-art; in the latter task our results significantly outperform earlier methods.

研究动机与目标

  • 解决自动论点质量评估领域缺乏高质量、大规模数据集的问题。
  • 通过大规模、受控的数据收集和严格的清洗流程,降低论点质量标注中的主观性。
  • 开发出在论点对分类任务中优于先前方法,并在论点排序任务中表现具有竞争力的神经网络模型。
  • 探究个体论点质量评分与成对比较之间的关系。
  • 发布数据集与模型,以支持未来在论点质量评估领域的研究。

提出的方法

  • 通过专用用户界面并遵循明确指南收集63,000个论点,确保受控且高质量的数据收集。
  • 对全部63,000个论点进行显式质量评分,评分范围为[0,1],支持个体论点质量评估。
  • 对14,000对论点进行标注,以识别每对中质量更高的论点,支持相对质量分类。
  • 应用清洗流程过滤低质量的贡献与标注,最终获得53,000个论点和9,100对用于评估。
  • 提出一种基于微调BERT架构的神经网络模型,用于论点对分类,以预测一对论点中哪个质量更高。
  • 提出一种基于相同BERT架构的神经网络模型,用于论点排序,以预测个体论点的质量评分。

实验结果

研究问题

  • RQ1显式个体论点质量标注的一致性与成对标注相比如何?
  • RQ2在新数据集上训练的神经网络模型是否能在论点对分类和论点排序任务中超越先前方法?
  • RQ3基于个体评分与成对比较的标注方案在多大程度上保持一致?
  • RQ4神经网络模型在论点质量评估中的失败模式是什么,尤其是针对表达质量与离题内容?
  • RQ5在差异较小时,能否从个体质量评分推断出成对标注结果?

主要发现

  • 新数据集IBM-ArgQ-6.3kArgs包含63,000个论点及其显式质量评分,规模是先前数据集(如UKPRank)的五倍。
  • 成对数据集IBM-ArgQ-14kPairs包含14,000对论点及其相对质量标签,支持对分类模型的稳健评估。
  • 所提出的论点对分类模型在IBM-ArgQ-9.1kPairs子集上显著优于早期方法,包括基于孪生网络的方法。
  • 论点排序模型的性能与最先进方法相当,验证了个体质量评分方案的有效性。
  • 尽管论点质量具有主观性,但两种标注方案(个体与成对)在标注者之间均表现出高度一致性。
  • 当论点的说服力强于其表达质量或拼写错误时,模型常出现失败;对离题或具有挑衅性的论点也表现不佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。