Skip to main content
QUICK REVIEW

[论文解读] proScript: Partially Ordered Scripts Generation via Pre-trained Language Models

Keisuke Sakaguchi, Chandra Bhagavatula|arXiv (Cornell University)|Apr 16, 2021
Topic Modeling参考文献 33被引用 8
一句话总结

本文提出了 proScript,一个大规模(6.4k)众包收集的日常场景部分有序脚本数据集,并提出了两种新型任务——边预测和完整脚本生成,采用微调的预训练语言模型进行处理。模型在边预测任务上表现优异(F1=75.7),首次证明生成模型能够有效生成结构化、部分有序的脚本,尽管与人类水平的准确率相比仍存在显著差距。

ABSTRACT

Scripts - standardized event sequences describing typical everyday activities - have been shown to help understand narratives by providing expectations, resolving ambiguity, and filling in unstated information. However, to date they have proved hard to author or extract from text. In this work, we demonstrate for the first time that pre-trained neural language models (LMs) can be be finetuned to generate high-quality scripts, at varying levels of granularity, for a wide range of everyday scenarios (e.g., bake a cake). To do this, we collected a large (6.4k), crowdsourced partially ordered scripts (named proScript), which is substantially larger than prior datasets, and developed models that generate scripts with combining language generation and structure prediction. We define two complementary tasks: (i) edge prediction: given a scenario and unordered events, organize the events into a valid (possibly partial-order) script, and (ii) script generation: given only a scenario, generate events and organize them into a (possibly partial-order) script. Our experiments show that our models perform well (e.g., F1=75.7 in task (i)), illustrating a new approach to overcoming previous barriers to script collection. We also show that there is still significant room for improvement toward human level performance. Together, our tasks, dataset, and models offer a new research direction for learning script knowledge.

研究动机与目标

  • 为解决长期以来在收集和生成高质量、结构化常识性脚本(用于日常场景)方面面临的挑战。
  • 构建一个大规模、众包收集的部分有序脚本数据集(proScript),以捕捉多样化的粒度和时间持续时长。
  • 提出两个互补任务:(i)边预测——给定一个场景和无序事件,预测一个有效的部分有序脚本;(ii)脚本生成——仅根据场景生成事件及其部分顺序。
  • 证明预训练语言模型可通过有效微调用于脚本生成,从而克服以往在脚本收集和建模方面的障碍。
  • 建立一个超越叙事完形填空任务的新基准,聚焦于完整脚本的结构和质量,以评估脚本知识。

提出的方法

  • 使用简化方法众包收集6.4k个部分有序脚本,附带事件粒度、时间持续时长和修改类型等标注。
  • 定义两个任务:(i)边预测——给定一个场景和无序事件,预测一个有效的部分有序脚本;(ii)脚本生成——仅从场景生成事件及其部分顺序。
  • 对预训练语言模型(如T5、BART)进行微调,以同时处理序列生成和图结构预测。
  • 使用图编辑距离和人工修订分析,将模型输出与人工标注的脚本进行对比评估。
  • 采用迁移学习和流水线基线方法,利用WikiHow和proScript_gen进行性能比较。
  • 实施人工评估,对错误类型(如顺序错误、事件缺失、改写事件)进行分类,以支持错误分析。

实验结果

研究问题

  • RQ1预训练语言模型是否能被有效微调,以生成高质量、部分有序的日常场景脚本?
  • RQ2在结构准确性和连贯性方面,模型生成的脚本与人工构建的脚本相比表现如何?
  • RQ3边预测和完整脚本生成任务在多大程度上捕捉了脚本知识的不同方面?
  • RQ4模型生成脚本中最常见的错误类型是什么?与人工修订模式相比有何异同?
  • RQ5迁移学习或流水线方法是否能超越在proScript上直接微调的性能,从而提升脚本生成效果?

主要发现

  • proScript数据集包含6,400个众包收集的部分有序脚本,附带多样化的粒度和时间持续时长标注,显著大于以往数据集。
  • 最佳模型在边预测任务上取得75.71的F1分数,优于基线模型,但仍低于人类表现(89.28)。
  • 在完整脚本生成任务中,最佳模型的图编辑距离为4.97,而人工脚本为2.98,表明仍有巨大提升空间。
  • 与边相关的修改(如顺序错误)是最常见的错误类型,表明当前模型在结构排序方面仍面临主要挑战。
  • 轻微修改(如改写、粒度调整)比关键错误(如事件缺失或无关事件)更常见,表明模型生成的是看似合理但结构有缺陷的脚本。
  • 迁移学习和流水线基线并未超越在proScript上直接微调的性能,表明proScript_gen本身已是脚本生成的强基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。