[论文解读] Unsupervised Extractive Summarization using Pointwise Mutual Information
本文提出了一种无监督抽取式摘要方法,利用句子之间的点互信息(PMI)来衡量句子与文档的相关性以及摘要内部的冗余度。通过使用微调后的预训练语言模型估算PMI,该方法采用贪心策略选择句子,以最大化相关性并最小化冗余,在新闻、医学文章和个人轶事等多样化领域中均优于基于相似度的基线方法。
Unsupervised approaches to extractive summarization usually rely on a notion of sentence importance defined by the semantic similarity between a sentence and the document. We propose new metrics of relevance and redundancy using pointwise mutual information (PMI) between sentences, which can be easily computed by a pre-trained language model. Intuitively, a relevant sentence allows readers to infer the document content (high PMI with the document), and a redundant sentence can be inferred from the summary (high PMI with the summary). We then develop a greedy sentence selection algorithm to maximize relevance and minimize redundancy of extracted sentences. We show that our method outperforms similarity-based methods on datasets in a range of domains including news, medical journal articles, and personal anecdotes.
研究动机与目标
- 为解决非新闻领域缺乏标注数据的问题,开发一种不依赖句子相似度的无监督抽取式摘要方法。
- 使用PMI作为相关性(句子-文档依赖)和冗余度(句子-句子依赖)的度量,形式化摘要中句子的重要性。
- 设计一种贪心句子选择算法,基于通过微调语言模型估算的PMI分数,最大化相关性并最小化冗余。
- 在包括新闻、医学文章和个人叙述在内的多种领域中展示泛化能力,这些领域中基于相似度的方法常表现不佳。
- 减少对位置偏置的依赖,该偏置会严重影响监督模型及某些抽取式基线方法(如PacSum)的表现。
提出的方法
- 相关性定义为摘要句子与文档之间的PMI,计算公式为 log(P(d|s)/P(d)),其中条件概率 P(d|s) 和边缘概率 P(d) 由语言模型估算。
- 冗余度通过摘要句子对之间的PMI来衡量,使用条件概率 P(s_j|s_i) 评估后一个句子是否可从前一个句子中推断得出。
- 该方法利用微调后的预训练语言模型(如BERT)高效且上下文相关地估算PMI分数,避免依赖词法或嵌入相似度。
- 采用贪心句子选择算法,按顺序添加能最大化相关性增益同时最小化冗余度的句子,基于累积的PMI分数进行决策。
- 该方法与位置无关,避免了PacSum等模型因依赖首句偏置而导致的性能偏差,尤其在非新闻数据集上表现更优。
- 通过在CNN/DM、Reddit-TIFU和医学文章数据集上使用ROUGE分数进行评估,并通过消融实验分离相关性和冗余性的贡献。
实验结果
研究问题
- RQ1基于PMI的相关性与冗余度度量是否能在无监督抽取式摘要中优于传统的基于句子相似度的特征?
- RQ2在选择标准中结合相关性与冗余度,在多样化领域中对摘要性能的提升程度如何?
- RQ3在缺乏首句偏置的情况下,所提出方法与基于位置的基线方法(如PacSum和lead-k)相比表现如何?
- RQ4使用预训练语言模型估算PMI是否能带来比词法或嵌入相似度更优的内容选择效果?
- RQ5在最终摘要性能中,相关性与冗余度的相对贡献分别是什么?
主要发现
- 所提方法在CNN/DM、Reddit-TIFU和医学文章数据集上均优于基于相似度的基线方法,在CNN/DM上达到36.68的ROUGE-1分数,在Reddit-TIFU上达到18.93。
- 消融实验表明,结合相关性与冗余度可获得最佳性能,仅使用相关性时ROUGE-1为35.17(CNN/DM),仅使用冗余度时表现较差,仅为23.85。
- 该方法与位置无关,避免了PacSum在CNN/DM上因首句偏置带来的优势,其中82.3%的PacSum所选句子位于前三个位置,而本方法仅为21.4%。
- PacSum与其他抽取式方法在CNN/DM上的性能差距主要源于位置偏置,因为PacSum在XSum数据集(无此类偏置)上性能显著下降。
- 该方法在领域间泛化能力出色,尤其在非新闻领域(如个人轶事和医学文章)中表现良好,而基于相似度的方法常表现不佳。
- 使用PMI作为语义依赖的度量,相比词法或嵌入相似度,能实现更合理的选句,表现为ROUGE分数的持续提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。