[论文解读] SUPERT: Towards New Frontiers in Unsupervised Evaluation Metrics for Multi-Document Summarization
SUPERT 是一种用于多文档摘要的新型无监督评估指标,通过使用上下文嵌入(例如 SBERT)和软标记对齐,从源文档中的关键句子生成伪参考摘要,以衡量语义相似度。与最先进的无监督指标相比,SUPERT 在与人类评分的相关性上提高了 18–39%,并在强化学习-based 摘要模型中将 ROUGE-2 分数提升最高达 17%。
We study unsupervised multi-document summarization evaluation metrics, which require neither human-written reference summaries nor human annotations (e.g. preferences, ratings, etc.). We propose SUPERT, which rates the quality of a summary by measuring its semantic similarity with a pseudo reference summary, i.e. selected salient sentences from the source documents, using contextualized embeddings and soft token alignment techniques. Compared to the state-of-the-art unsupervised evaluation metrics, SUPERT correlates better with human ratings by 18-39%. Furthermore, we use SUPERT as rewards to guide a neural-based reinforcement learning summarizer, yielding favorable performance compared to the state-of-the-art unsupervised summarizers. All source code is available at https://github.com/yg211/acl20-ref-free-eval.
研究动机与目标
- 开发一种无需人工编写参考摘要或人工标注的多文档摘要无监督评估指标。
- 提高自动评估得分与人类对摘要相关性判断之间的一致性。
- 探索将 SUPERT 作为强化学习摘要模型中的奖励信号,以减少对人工标注数据的依赖。
- 解决多文档摘要任务中人工标注评估的高成本与可扩展性问题。
- 证明 SUPERT 可在无监督设置下引导神经摘要模型达到最先进性能。
提出的方法
- 通过位置感知的图注意力方法等启发式方法,从每篇源文档中选取前 10 或前 15 个关键句子,构建伪参考摘要。
- 使用上下文嵌入(如 SBERT)对生成的摘要和伪参考摘要进行编码。
- 应用软标记对齐,在标记层面计算摘要与伪参考摘要之间的语义相似度。
- 将摘要的相关性度量为生成摘要与伪参考摘要之间语义相似度的平均值。
- 在强化学习框架(NTD)中集成 SUPERT 作为奖励函数,以训练抽取式摘要模型。
- 使用 SUPERT 得分作为密集且连续的奖励,对强化学习模型进行端到端优化,无需人工标注。
实验结果
研究问题
- RQ1无监督评估指标能否显著提升与人类相关性评分的相关性,优于现有无监督指标?
- RQ2上下文嵌入与软标记对齐在衡量摘要与源文档之间语义重叠方面有多有效?
- RQ3SUPERT 是否能作为强大且可扩展的奖励信号,用于在无人工标注的情况下训练强化学习摘要模型?
- RQ4使用源文档中的关键句子作为伪参考,是否优于更简单的基线方法(如使用整篇文档作为伪参考)?
- RQ5与最先进方法相比,SUPERT 在多大程度上提升了无监督神经摘要模型的性能?
主要发现
- 在 TAC’08 和 TAC’09 数据集上,SUPERT 与人类相关性评分的 Kendall’s τ 相关系数比最先进的无监督指标高出 18–39%。
- 最佳 SUPERT 变体(使用前 10/15 个句子和 SBERT 嵌入)在评估和强化学习设置中均优于所有基线方法。
- 当作为 NTD(一种强化学习摘要模型)的奖励时,SUPERT 在 TAC’08 上达到与最先进无监督方法(YLS15)相当的性能,在 TAC’09 上表现更优,ROUGE-2 分数提升达 17%。
- 用于构建伪参考摘要的位置感知图方法优于无位置感知的方法,甚至超越简单的前几句选择方法,表明结构化句子关系有助于提升关键性检测效果。
- 将 SUPERT 作为奖励可实现数据高效的强化学习摘要模型训练,通过从无标签文档中生成无限多的摘要-奖励对,有效缓解了数据饥渴问题。
- 基于 SUPERT 的训练可生成更相关且更流畅的摘要,表现为 ROUGE 分数更高,且与人类判断的对齐性更强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。