Skip to main content
QUICK REVIEW

[论文解读] Automatic Article Commenting: the Task and Dataset

Lianhui Qin, Lemao Liu|arXiv (Cornell University)|May 9, 2018
Topic Modeling参考文献 40被引用 12
一句话总结

本文提出了自动文章评论任务,并构建了一个大规模中文数据集,包含450万条真实评论,以及一个由人工标注的4.3万条评论质量评分子集。本文提出了一组加权自动评估指标(W-METEOR、W-Rouge_L等),将人工标注的评论质量分数融入指标计算中,显著提升了与人工评估的相关性,优于标准指标。

ABSTRACT

Comments of online articles provide extended views and improve user engagement. Automatically making comments thus become a valuable functionality for online forums, intelligent chatbots, etc. This paper proposes the new task of automatic article commenting, and introduces a large-scale Chinese dataset with millions of real comments and a human-annotated subset characterizing the comments' varying quality. Incorporating the human bias of comment quality, we further develop automatic metrics that generalize a broad set of popular reference-based metrics and exhibit greatly improved correlations with human evaluations.

研究动机与目标

  • 定义并形式化一种新型自动文章评论任务,该任务与摘要和产品评论任务有明显区别。
  • 解决在相关性、信息量和流畅性方面质量参差不齐的开放域、多样化评论的评估挑战。
  • 通过引入人工标注的评论质量分数,开发出更贴近人类判断的自动评估指标。
  • 提供一个大规模、高质量的数据集,用于训练和评估自动文章评论模型。
  • 通过在检索模型和序列到序列模型上进行基线模型评估,展示数据集和增强指标的实用性。

提出的方法

  • 收集了一个大规模中文文章-评论数据集,包含约20万篇文章和450万条人工评论,包含用户投票、类别等元数据。
  • 对4.3万条评论的子集进行人工评分(1–5分),评分标准包括相关性、信息量和流畅性等。
  • 提出加权自动评估指标(W-METEOR、W-Rouge_L、W-BLEU、W-CIDEr),在评估过程中为高质量参考评论分配更高权重。
  • 利用人工标注的评分对标准指标中的参考评论进行重新加权,从而提升与人类判断的一致性。
  • 将增强后的指标应用于该数据集上,评估检索模型和序列到序列生成模型的表现。
  • 通过对比标准指标,验证加权指标的有效性,显示其与人类评估分数的相关性显著提升。

实验结果

研究问题

  • RQ1鉴于自动文章评论任务具有开放域、多样化和质量不一的特性,我们应如何定义并评估该任务?
  • RQ2标准自动评估指标(如BLEU、METEOR)与人类对评论质量的判断之间相关性如何?
  • RQ3将人工标注的评论质量分数融入自动评估指标,能否显著提升其与人类评估的相关性?
  • RQ4在所提出的数据集上,使用标准指标和加权指标时,基线模型(检索模型和seq2seq模型)的表现如何?
  • RQ5所提出的数据集和评估指标能否支持更高效自动文章评论系统的发展?

主要发现

  • 所提出的数据集包含20万篇文章和450万条评论,其中4.3万条评论经过人工质量标注,支持稳健的评估。
  • 标准指标如METEOR和BLEU与人类判断的相关性较低(例如,在检索模型上METEOR的皮尔逊相关系数r = 0.137),表明其与人类感知存在明显偏差。
  • 加权指标(W-METEOR、W-Rouge_L)显著提升了与人类评估的相关性,其中W-METEOR在检索模型上达到r = 0.130,在seq2seq模型上达到r = 0.074。
  • W-METEOR指标能有效降低低质量参考评论的影响,定性分析显示其比原始METEOR更符合人类判断。
  • 对模型输出的人工评估得分较低(例如seq2seq模型得分为1.35),表明自动文章评论模型仍有巨大提升空间。
  • 结果表明,通过在参考文本加权中引入人类偏好,可实现更可靠的自动评估,验证了该方法在未来研究中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。