Skip to main content
QUICK REVIEW

[论文解读] Counterfactual Story Reasoning and Generation

Lianhui Qin, Antoine Bosselut|arXiv (Cornell University)|Sep 9, 2019
Topic Modeling参考文献 33被引用 5
一句话总结

本文提出了反事实故事重写(Counterfactual Story Rewriting)这一新任务,要求模型在引入给定反事实事件时,以最小改动使故事保持因果一致性。作者构建了 TimeTravel 数据集,其中包含 29,849 个由人工标注的反事实修订样本,并表明当前最先进语言模型在因果一致性方面表现不佳,凸显了神经生成模型中改进推理能力的必要性。

ABSTRACT

Counterfactual reasoning requires predicting how alternative events, contrary to what actually happened, might have resulted in different outcomes. Despite being considered a necessary component of AI-complete systems, few resources have been developed for evaluating counterfactual reasoning in narratives. In this paper, we propose Counterfactual Story Rewriting: given an original story and an intervening counterfactual event, the task is to minimally revise the story to make it compatible with the given counterfactual event. Solving this task will require deep understanding of causal narrative chains and counterfactual invariance, and integration of such story reasoning capabilities into conditional language generation models. We present TimeTravel, a new dataset of 29,849 counterfactual rewritings, each with the original story, a counterfactual event, and human-generated revision of the original story compatible with the counterfactual event. Additionally, we include 80,115 counterfactual "branches" without a rewritten storyline to support future work on semi- or un-supervised approaches to counterfactual story rewriting. Finally, we evaluate the counterfactual rewriting capacities of several competitive baselines based on pretrained language models, and assess whether common overlap and model-based automatic metrics for text generation correlate well with human scores for counterfactual rewriting.

研究动机与目标

  • 填补故事理解与生成中针对反事实叙事推理的基准研究空白。
  • 设计一项新任务,要求在引入反事实事件时,对故事进行最小化且因果一致的修改。
  • 构建大规模、人工标注的数据集,以支持反事实故事重写与推理的研究。
  • 在零样本、无监督和有监督设置下,评估预训练语言模型在该新任务上的表现。
  • 评估自动指标与人工判断在反事实重写质量上的相关性。

提出的方法

  • 提出反事实故事重写作为新任务:在最小化修改的前提下,使故事与给定的反事实事件保持一致。
  • 通过众包工作者从 ROCStories 语料库中收集故事,构建包含 29,849 个反事实修订的 TimeTravel 数据集。
  • 额外包含 80,115 个未重写的反事实分支,以支持半监督或弱监督学习。
  • 在重写任务上,对 GPT 和 GPT-2 模型的多种变体进行零样本、无监督和有监督设置下的训练与评估。
  • 使用 BERTScore、WMS 及其他基于模型的指标评估生成质量,并与人工标注结果进行对比。
  • 在 800 个验证样本上计算自动指标得分与人工判断之间的皮尔逊相关系数,以评估指标的可靠性。

实验结果

研究问题

  • RQ1预训练语言模型能否在最小修改下生成与反事实一致的故事修订?
  • RQ2标准自动指标(BLEU、ROUGE、WMS、BERTScore)与人工判断在反事实重写质量上的相关性如何?
  • RQ3哪些自动指标最能捕捉人工标注的质量,涵盖前提遵循性、情节一致性及反事实条件一致性?
  • RQ4当前模型在反事实重写中表现出的因果推理程度如何,还是主要依赖模式化生成?
  • RQ5数据集中包含未配对的反事实分支在多大程度上支持未来的半监督或自监督学习方法?

主要发现

  • 最先进的语言模型(包括 GPT 和 GPT-2 变体)在生成一致的反事实修订方面表现不佳,常无法维持因果连贯性。
  • 常见的自动指标(如 BLEU 和 ROUGE)与人工判断的相关性较差,尤其在反事实条件遵循性方面,甚至出现负相关。
  • BERTScore 在反事实理解方面与人工评分的相关性最强,但相关性依然微弱,且指标难以有效区分模型性能差异。
  • 结果表明,当前模型主要依赖表面模式而非深层因果推理,揭示了推理能力的根本性差距。
  • TimeTravel 数据集为反事实故事生成的半监督或弱监督学习开辟了新的研究方向。
  • 最小化修改对保持因果不变性至关重要,但模型常在修改依赖事件的同时未能保留不变要素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。