Skip to main content
QUICK REVIEW

[论文解读] Transformers Go for the LOLs: Generating (Humourous) Titles from Scientific Abstracts End-to-End

Yanran Chen, Steffen Eger|arXiv (Cornell University)|Dec 20, 2022
Topic Modeling被引用 9
一句话总结

本文提出使用微调的Transformer模型,实现从科学摘要到标题的端到端标题生成,包括一个包含2,638个幽默标注的科学标题新数据集。研究发现,尽管最佳微调模型的性能几乎与人工撰写标题相当,但幽默生成仍具挑战性——模型在表现上仍逊于人类,且易学习数据集中的表层模式;而即使零样本的ChatGPT也无需任何微调即可达到最佳微调系统的表现。

ABSTRACT

We consider the end-to-end abstract-to-title generation problem, exploring seven recent transformer based models (including ChatGPT) fine-tuned on more than 30k abstract-title pairs from NLP and machine learning (ML) venues. As an extension, we also consider the harder problem of generating humorous paper titles. For the latter, we compile the first large-scale humor annotated dataset for scientific papers in the NLP/ML domains, comprising almost ~2.6k titles. We evaluate all models using human and automatic metrics. Our human evaluation suggests that our best end-to-end system performs similarly to human authors (but arguably slightly worse). Generating funny titles is more difficult, however, and our automatic systems clearly underperform relative to humans and often learn dataset artefacts of humor. Finally, ChatGPT, without any fine-tuning, performs on the level of our best fine-tuned system.

研究动机与目标

  • 开发基于Transformer的端到端模型,从摘要生成科学论文标题。
  • 探究生成幽默科学论文标题的可行性,该任务因幽默的模糊性和主观性而复杂。
  • 创建并发布首个大规模、人工标注的自然语言处理与机器学习领域幽默科学标题数据集。
  • 对比微调模型与零样本大语言模型(如ChatGPT)在标题生成质量上的表现。
  • 分析当前模型的局限性,尤其是捕捉微妙幽默的能力不足及幻觉问题。

提出的方法

  • 在来自自然语言处理与机器学习会议的30,352对摘要-标题数据上,微调了七种近期的基于Transformer的模型(包括BART、LED和GPT变体)。
  • 扩展训练过程,引入一个大规模的新幽默标注数据集,包含2,638个标题,由两名人类标注者进行标注,一致性较高(kappa ≈ 0.65)。
  • 同时使用自动指标(ROUGE)和由15名标注者进行的人工评估,以衡量标题质量与幽默程度。
  • 比较仅使用摘要(A)的端到端模型与通过在标题中插入</s>分隔符连接其他部分(如结论)的模型(X)的表现。
  • 评估ChatGPT在该任务上的零样本性能,且未进行任何微调。
  • 通过对比[MODEL]+A与[MODEL]+X变体的输出,开展消融研究,分析模型行为,包括幻觉现象与关键词遗漏。

实验结果

研究问题

  • RQ1端到端的Transformer模型能否生成与人工撰写标题相当的高质量科学论文标题?
  • RQ2微调模型在生成幽默科学标题方面的有效性如何?它们是否学习到了真正的幽默,还是仅学习了数据集中的表层模式?
  • RQ3在摘要之外引入额外部分(如结论)在多大程度上能提升标题生成质量?
  • RQ4零样本的ChatGPT在摘要到标题生成任务上的表现与微调模型相比如何?
  • RQ5当前模型为何在幽默生成方面表现不佳?其主要失败模式是什么?

主要发现

  • 最佳微调模型在人工评估中表现几乎与人工撰写标题持平,但略逊一筹。
  • 幽默生成仍是重大挑战:模型明显逊于人类,且常学习到数据集中的表面模式而非真正的幽默。
  • 未经过任何微调的ChatGPT生成的标题质量与最佳微调模型相当,表明其具备强大的零样本泛化能力。
  • 仅基于摘要(A)训练的模型频繁遗漏其他部分中存在的关键信息,导致标题不完整或不准确。
  • 基于完整文本输入(X)训练的模型表现有所提升,尤其在捕捉关键词方面,但仍存在幻觉和对表面模式的过度依赖。
  • 本研究揭示,A2T任务本质上是病态的,因为高质量标题通常需要超越摘要的知识,但端到端模型仍是可行且高效的近似方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。