[论文解读] TGSum: Build Tweet Guided Multi-Document Summarization Dataset
本文提出TGSum方法,通过利用推文作为社交信号,自动构建大规模、高质量的多文档摘要数据集。通过话题标签进行主题聚类,通过超链接识别关键点,采用整数线性规划(ILP)模型从文档和高质量推文中选择最优句子,以最大化基于ROUGE的覆盖度。该数据集在作为训练数据使用时,显著提升了监督摘要模型的性能。
The development of summarization research has been significantly hampered by the costly acquisition of reference summaries. This paper proposes an effective way to automatically collect large scales of news-related multi-document summaries with reference to social media's reactions. We utilize two types of social labels in tweets, i.e., hashtags and hyper-links. Hashtags are used to cluster documents into different topic sets. Also, a tweet with a hyper-link often highlights certain key points of the corresponding document. We synthesize a linked document cluster to form a reference summary which can cover most key points. To this aim, we adopt the ROUGE metrics to measure the coverage ratio, and develop an Integer Linear Programming solution to discover the sentence set reaching the upper bound of ROUGE. Since we allow summary sentences to be selected from both documents and high-quality tweets, the generated reference summaries could be abstractive. Both informativeness and readability of the collected summaries are verified by manual judgment. In addition, we train a Support Vector Regression summarizer on DUC generic multi-document summarization benchmarks. With the collected data as extra training resource, the performance of the summarizer improves a lot on all the test sets. We release this dataset for further research.
研究动机与目标
- 为解决多文档摘要任务中大规模、人工标注的参考摘要稀缺的问题。
- 开发一种自动化方法,利用Twitter上的社交媒体反馈收集信息丰富且可读性强的参考摘要。
- 构建一个可扩展的数据集,以支持监督摘要模型的训练与评估。
- 通过引入自动收集的摘要作为额外训练数据,提升现有摘要模型的性能。
提出的方法
- 利用推文中的话题标签,将新闻文章聚类为特定主题的文档簇。
- 通过分析带超链接的推文(即链接推文),识别高显著性内容,这些推文通常突出新闻文章的关键点。
- 将摘要任务建模为整数线性规划(ILP)问题,以最大化基于ROUGE的关键点覆盖度。
- 从原始文档和高质量推文中选择摘要句子,以确保摘要的可读性与完整性。
- 应用ROUGE指标衡量覆盖度,并引导ILP求解器逼近摘要质量的理论上限。
- 通过人工评估验证生成摘要的信息量与可读性。
实验结果
研究问题
- RQ1社交媒体信号(如话题标签和超链接)能否被有效用于自动生成多文档摘要的参考摘要?
- RQ2基于ILP的句子选择策略在多大程度上能最大化ROUGE分数,同时确保摘要的连贯性与覆盖度?
- RQ3将从推文自动收集的摘要纳入训练数据,对监督摘要模型的性能提升有多大影响?
- RQ4所提出的方法能否实现规模化,生成大规模、多样化且高质量的数据集,以支持深度学习模型的训练?
主要发现
- TGSum数据集包含4,658条链接推文,分布在465个文档簇中,平均每簇23条推文,其规模超过DUC数据集。
- 人工评估确认,生成的摘要既信息丰富又可读,高质量内容同时来源于文档和精选推文。
- 当用作额外训练数据时,TGSum显著提升了支持向量回归(SVR)摘要模型在所有DUC测试集上的性能,其中在02测试集上ROUGE-L F1分数从30.32提升至32.15,在04测试集上从36.64提升至36.64。
- TGSum数据的引入在所有测试集上均带来一致的性能提升,证明其在增强模型泛化能力方面的有效性。
- 该方法通过从文档中选择完整且表达清晰的句子,以及从推文中选取高显著性内容,成功平衡了抽取式与生成式元素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。