Skip to main content
QUICK REVIEW

[论文解读] CREATIVESUMM: Shared Task on Automatic Summarization for Creative Writing

Divyansh Agarwal, Alexander R. Fabbri|arXiv (Cornell University)|Nov 10, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本论文介绍了CreativeSumm,这是COLING 2022的一项共享任务,聚焦于跨四个领域(书籍章节、电影剧本、黄金时段电视剧剧本和日间肥皂剧剧本)的创意写作自动摘要。该任务提供了精心筛选的数据集、评估指标,并分析了18项提交结果,揭示了在处理复杂叙事结构和特定类型风格方面面临的挑战,ROUGE得分范围为0.29至0.39,且在忠实度和连贯性指标上表现不佳。

ABSTRACT

This paper introduces the shared task of summarizing documents in several creative domains, namely literary texts, movie scripts, and television scripts. Summarizing these creative documents requires making complex literary interpretations, as well as understanding non-trivial temporal dependencies in texts containing varied styles of plot development and narrative structure. This poses unique challenges and is yet underexplored for text summarization systems. In this shared task, we introduce four sub-tasks and their corresponding datasets, focusing on summarizing books, movie scripts, primetime television scripts, and daytime soap opera scripts. We detail the process of curating these datasets for the task, as well as the metrics used for the evaluation of the submissions. As part of the CREATIVESUMM workshop at COLING 2022, the shared task attracted 18 submissions in total. We discuss the submissions and the baselines for each sub-task in this paper, along with directions for facilitating future work in the field.

研究动机与目标

  • 通过聚焦于创意写作,推动自动文本摘要研究超越新闻和专业技术领域。
  • 解决在处理具有非线性情节发展和角色相互依赖关系的长篇、结构复杂的创意文本时所面临的未充分探索的挑战。
  • 为四种不同的创意类型(文学书籍、电影剧本、黄金时段电视剧和日间肥皂剧)提供标准化的数据集和评估协议。
  • 在这些新颖任务上评估最先进模型,并识别在忠实度、连贯性和生成性能力方面的局限性。
  • 通过扩展数据集和改进评估指标,激发未来在创意文本摘要领域的研究工作。

提出的方法

  • 利用现有数据集,精心设计了四个子任务:BookSumm-chapters(来自Project Gutenberg和学习指南)、Scriptbase(带有用户摘要的电影剧本)以及SummScreen(黄金时段和日间电视剧剧本文本)。
  • 整合并筛选数据集,确保书籍标题无重叠,并移除不可靠或非叙事性内容(如戏剧)。
  • 建立评估协议,使用ROUGE、LEXICAL以及忠实度指标(SummaC、LP)来评估事实一致性和内容覆盖度。
  • 提供基线模型,包括在每个子任务上微调的LED和BART架构,辅以消融实验和超参数调优。
  • 在COLING 2022上举办共享任务,收集了针对四个子任务的18项提交结果,用于对比分析。
  • 使用GitHub仓库共享数据、使用说明和评估脚本,以确保可复现性并支持未来扩展。

实验结果

研究问题

  • RQ1现有序列到序列模型在总结具有复杂叙事结构的长篇创意文本时表现如何?
  • RQ2在文学小说、电影剧本以及黄金时段与日间电视剧之间,摘要性能的关键差异是什么?
  • RQ3当前模型在创意内容摘要中保持事实一致性和叙事连贯性的程度如何?
  • RQ4不同评估指标(ROUGE、SummaC、LP)与人类对创意文本摘要质量判断的相关性如何?
  • RQ5当前模型在总结具有非传统话语结构的创意文本时,主要的失败模式是什么?

主要发现

  • 各子任务的ROUGE-1得分在0.29至0.39之间,其中在Scriptbase(电影剧本)任务上表现最佳。
  • 所有系统在忠实度指标上表现均较差:LP得分低于0.5,SummaC得分持续偏低,表明事实一致性差。
  • SummScreenFD(日间肥皂剧)任务中表现最佳的系统生成了更短、更具生成性的摘要,表明针对特定类型的摘要策略是有效的。
  • 基于LED的基线模型在SummScreenTMS(黄金时段电视剧)任务上表现不佳,产生重复且以抽取为主的输出,可能由于训练优化问题所致。
  • SummScreenFD与TMS之间ROUGE-1得分差异显著(0.29 vs. 0.39),凸显即使在同一领域内,数据分布也存在显著差异。
  • 尽管在电影剧本任务上ROUGE得分较高,但系统在连贯性和事实准确性方面仍表现不佳,表明自动指标与人类评估之间存在明显差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。