Skip to main content
QUICK REVIEW

[论文解读] Subjective Bias in Abstractive Summarization

Lei Li, Wei Liu|arXiv (Cornell University)|Jun 18, 2021
Topic Modeling参考文献 22被引用 4
一句话总结

本文提出一种基于图卷积网络(GCN)的图嵌入方法,用于识别和聚类摘要数据集中主观写作风格。在CNN-DM数据集上的实验表明,仅在单一风格聚类上进行训练可提升模型收敛性、抽象能力和泛化性能,尤其对特定风格效果显著;而混合所有风格则会损害性能,挑战了‘多样化的黄金摘要始终有益于训练’的假设。

ABSTRACT

Due to the subjectivity of the summarization, it is a good practice to have more than one gold summary for each training document. However, many modern large-scale abstractive summarization datasets have only one-to-one samples written by different human with different styles. The impact of this phenomenon is understudied. We formulate the differences among possible multiple expressions summarizing the same content as subjective bias and examine the role of this bias in the context of abstractive summarization. In this paper a lightweight and effective method to extract the feature embeddings of subjective styles is proposed. Results of summarization models trained on style-clustered datasets show that there are certain types of styles that lead to better convergence, abstraction and generalization. The reproducible code and generated summaries are available online.

研究动机与目标

  • 探究黄金摘要中主观写作风格差异对生成式摘要模型性能的影响。
  • 提出一种从人工标注摘要中提取并聚类主观写作风格的方法。
  • 评估在风格聚类数据集上训练是否能带来优于混合风格数据集的收敛性、抽象能力和泛化性能。
  • 挑战‘多样化黄金摘要始终能提升模型性能’的普遍假设。

提出的方法

  • 使用图结构表示摘要中的句法结构,以捕捉从源文章(oracle)到摘要的句法转换。
  • 采用自监督图卷积网络(GCN)从这些句法图中学习主观风格嵌入。
  • 基于学习到的风格嵌入对数据集进行聚类,形成特定风格的训练集。
  • 在每个风格聚类数据集上微调T5-small模型,并与在完整混合风格数据集上训练的基线模型进行性能对比。
  • 基于最近邻质心对测试样本进行聚类分类,以评估风格特定模型的泛化能力。
  • 使用ROUGE、BERTScore等指标报告结果,以评估抽象能力、流畅性及事实一致性。

实验结果

研究问题

  • RQ1黄金摘要中主观写作风格的差异如何影响生成式摘要模型的性能?
  • RQ2能否通过基于图结构的自监督GCN方法有效提取并嵌入主观风格?
  • RQ3在单一同质风格上训练是否优于在混合风格数据集上训练,从而实现更好的模型收敛与泛化?
  • RQ4是否存在某些特定主观风格在ROUGE分数和抽象质量方面始终优于其他风格?
  • RQ5将所有风格混合在数据集中是否真能实现最优模型性能,还是反而引入噪声导致性能下降?

主要发现

  • 在单一同质风格(如Cluster_1)上训练可带来比在完整混合风格数据集上训练更好的收敛性与更高的ROUGE分数。
  • 在Cluster_1上训练的模型取得了最高的ROUGE-1(40.2)与ROUGE-2(17.3)分数,优于基线模型及完整数据集微调模型。
  • 完整数据集微调模型收敛最慢且性能最差,ROUGE-2 F1仅为16.1,表明混合风格可能阻碍学习。
  • 未进行微调的模型在摘要相关指标上反而优于微调的完整数据集模型,表明微调可能导致抽象能力下降,因存在复制粘贴倾向。
  • 每样本最佳摘要的集成(Cluster_Best)实现了ROUGE-2 F1为20.0,几乎与完整数据集上4模型集成的性能相当,暗示混合所有风格并非最优策略。
  • 风格1最有利于模型学习,因为基于该风格训练的模型在同风格测试集上表现最佳,表明模型对特定摘要模式存在偏好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。