QUICK REVIEW
[论文解读] Dimsum @LaySumm 20: BART-based Approach for Scientific Document Summarization
Tiezheng Yu, Dan Su|arXiv (Cornell University)|Oct 19, 2020
Topic Modeling参考文献 23被引用 9
一句话总结
本文提出了一种基于BART的科学文献通俗摘要模型,通过使用句子级别的标签作为辅助监督信号来提升性能。该方法在CL-LaySumm 2020共享任务上取得了46.00%的Rouge1-F1得分,表明多标签监督通过增强生成式摘要过程中的句子级理解,提升了精确率和F1值。
ABSTRACT
Lay summarization aims to generate lay summaries of scientific papers automatically. It is an essential task that can increase the relevance of science for all of society. In this paper, we build a lay summary generation system based on the BART model. We leverage sentence labels as extra supervision signals to improve the performance of lay summarization. In the CL-LaySumm 2020 shared task, our model achieves 46.00\% Rouge1-F1 score.
研究动机与目标
- 应对日益增长的自动化通俗摘要需求,以提升公众对科学研究的可及性。
- 通过引入句子级别的标签作为辅助监督,改进科学论文的生成式摘要性能。
- 研究输入组成(摘要、引言、结论)、数据增强以及两阶段微调对摘要性能的影响。
- 评估多标签监督在提升通俗摘要精确率和F1得分方面的有效性。
- 开发一种稳健且可迁移的模型,用于生成简洁、非技术性的摘要,适合普通受众。
提出的方法
- 在科学论文上微调BART-large模型,输入由摘要、引言和结论部分组成。
- 在每个句子前引入[CLS]标记,并在训练过程中使用二值句子标签作为额外的监督信号。
- 端到端训练模型,结合生成式摘要损失与抽取式句子选择损失。
- 由于GPU显存限制,采用动态学习率调度,设置1000个热身步数,并在10次迭代中累积梯度。
- 实施基于同义词替换的数据增强,以增加训练数据的多样性,但因潜在的语法噪声而效果有限。
- 采用两阶段微调策略,先在ScisummNet上微调,再在CL-LaySumm 2020上微调,但由于领域差异,性能未见提升。
实验结果
研究问题
- RQ1将句子级别的标签作为监督信号,如何提升生成式通俗摘要的性能?
- RQ2在生成简洁、高质量通俗摘要时,最优的输入组成(如仅摘要 vs. 摘要+引言+结论)是什么?
- RQ3使用同义词替换进行数据增强是否能提升模型在CL-LaySumm 2020基准上的泛化能力和性能?
- RQ4尽管存在领域差异,先在ScisummNet上微调再在CL-LaySumm 2020上微调,是否能提升模型性能?
- RQ5不同输入长度和内容选择策略如何影响模型生成准确且简洁通俗摘要的能力?
主要发现
- 将引言和结论加入输入后,Rouge1-F1从仅使用摘要的43.50%显著提升至45.36%。
- 使用完整的引言而非仅第一段,性能略有下降,可能由于输入长度增加和噪声增多。
- 多标签监督使Rouge1-F1提升至46.00%,并提高了精确率,表明模型在句子级重要性检测方面表现更优。
- 基于同义词替换的数据增强未提升性能,反而可能引入噪声,降低模型鲁棒性。
- 两阶段微调未能提升性能,可能由于ScisummNet(计算语言学领域)与CL-LaySumm 2020(多领域科学论文)之间存在领域差异。
- 最终模型在CL-LaySumm 2020测试集上达到46.00%的Rouge1-F1得分,优于未使用多标签监督的基线BART模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。