Skip to main content
QUICK REVIEW

[论文解读] Argument Mining for Understanding Peer Reviews

Xinyu Hua, Mitko Nikolov|arXiv (Cornell University)|Mar 25, 2019
Topic Modeling参考文献 42被引用 5
一句话总结

本文介绍了 AMPERE,一个包含 400 篇经过同行评审的机器学习与自然语言处理论文的新数据集,其中标注了 10,386 个论辩性命题及其类型(例如:评估、请求、事实)。通过使用最先进的论辩挖掘模型,研究发现不同会议的同行评审展现出独特的结构模式,且由于句子密集且包含多个命题,导致命题分割性能显著下降——凸显了学术话语中论辩挖掘面临的新挑战。

ABSTRACT

Peer-review plays a critical role in the scientific writing and publication ecosystem. To assess the efficiency and efficacy of the reviewing process, one essential element is to understand and evaluate the reviews themselves. In this work, we study the content and structure of peer reviews under the argument mining framework, through automatically detecting (1) argumentative propositions put forward by reviewers, and (2) their types (e.g., evaluating the work or making suggestions for improvement). We first collect 14.2K reviews from major machine learning and natural language processing venues. 400 reviews are annotated with 10,386 propositions and corresponding types of Evaluation, Request, Fact, Reference, or Quote. We then train state-of-the-art proposition segmentation and classification models on the data to evaluate their utilities and identify new challenges for this new domain, motivating future directions for argument mining. Further experiments show that proposition usage varies across venues in amount, type, and topic.

研究动机与目标

  • 通过论辩挖掘的视角,理解同行评审的内容与结构。
  • 解决论辩挖掘领域中同行评审分析缺乏标注数据集的问题。
  • 在新领域——学术同行评审——上对当前最先进的论辩挖掘模型进行基准测试。
  • 揭示主要机器学习与自然语言处理会议中命题使用方式的差异。
  • 识别出与同行评审话语相关的命题分割与分类的新挑战。

提出的方法

  • 从 ICLR、UAI、ACL 和 NeurIPS(2013–2018)收集了 14,202 份同行评审用于数据集构建。
  • 对 400 份评审进行标注,共识别出 10,386 个命题,每个命题被标记为六种类型之一:评估、请求、事实、引用、引用内容或非论辩。
  • 实现了较高的标注者间一致性(分割任务的 Cohen’s κ = 0.93;类型标注的 Krippendorf’s αU = 0.61)。
  • 在 AMPERE 数据集上训练并评估了当前最先进的命题分割与分类模型。
  • 使用似然比检验与 χ² 检验,识别每类命题与会议的显著词汇。
  • 构建了命题转移概率矩阵,以分析论辩结构与序列模式。

实验结果

研究问题

  • RQ1在不同机器学习与自然语言处理会议中,同行评审中的论辩性命题在类型、频率与结构上如何变化?
  • RQ2现有论辩挖掘模型在同行评审文本上的泛化能力如何?该领域面临哪些挑战?
  • RQ3与不同命题类型相关的显著语言特征(如显著词汇)有哪些?
  • RQ4高分与低分评审的论辩结构——特别是命题转移——有何不同?
  • RQ5基于评分(如强接受与强拒绝)的同行评审中,会浮现哪些结构模式?

主要发现

  • 与先前领域相比,AMPERE 上的命题分割性能显著下降,25% 的句子包含超过一个命题(而论文中仅为 8%)。
  • ACL 评审中的命题总数多于机器学习会议,尤其包含更多请求类命题,而事实类命题更少。
  • 具有极端评分(强接受或强拒绝)的评审更短,且请求类命题显著少于中等评分的评审。
  • ICLR 审稿人频繁评估模型架构,尤其常提及 'network' 和 'training',而 ACL 审稿人更常请求 'examples'。
  • 命题转移矩阵显示,同类命题具有较高的自转移概率,表明相同类型的命题常连续出现,但引用类命题通常后接评估类命题。
  • 显著词汇分析显示,NeurIPS 评审常提及 'equations',而 ICLR 评审在评估中更强调 'network' 和 'training'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。