[论文解读] At Which Level Should We Extract? An Empirical Study on Extractive Document Summarization
本文研究了在抽取式文档摘要中,将子句内单元作为替代抽取单元的可行性,提出了一种利用短语结构解析树识别并抽取有意义短语的神经网络模型。实验表明,子句内抽取在自动评估和人工评估中均达到或超过全句抽取的效果,提供了一种更精确、更少冗余的摘要方法。
Extractive methods have been proven effective in automatic document summarization. Previous works perform this task by identifying informative contents at sentence level. However, it is unclear whether performing extraction at sentence level is the best solution. In this work, we show that unnecessity and redundancy issues exist when extracting full sentences, and extracting sub-sentential units is a promising alternative. Specifically, we propose extracting sub-sentential units based on the constituency parsing tree. A neural extractive model which leverages the sub-sentential information and extracts them is presented. Extensive experiments and analyses show that extracting sub-sentential units performs competitively comparing to full sentence extraction under the evaluation of both automatic and human evaluations. Hopefully, our work could provide some inspiration of the basic extraction units in extractive summarization for future research.
研究动机与目标
- 探究句级抽取是否在抽取式文档摘要中为最优方案。
- 识别全句抽取方法中的冗余和无用内容。
- 探索子句内单元作为抽取式摘要中更精确的替代方案。
- 开发一种能够有效抽取信息性子句内单元的神经网络模型。
提出的方法
- 该方法利用短语结构解析树识别句法成分作为候选子句内单元。
- 训练一个神经抽取模型,对信息量最大的子句内单元进行打分和选择。
- 根据其句法结构和语义相关性抽取子句内单元。
- 模型结合句法结构与上下文嵌入,以提高抽取的准确性。
- 采用标准自动评估指标和人工评估对方法进行评估。
- 在相同实验设置下,将该系统与句级抽取基线方法进行对比。
实验结果
研究问题
- RQ1句级抽取是否为抽取式摘要中最有效的抽取单元?
- RQ2与全句相比,子句内单元是否能减少冗余并提升摘要质量?
- RQ3神经网络模型能否有效抽取并排序信息性子句内单元?
- RQ4在自动评估和人工评估中,子句内抽取与句级抽取相比表现如何?
主要发现
- 子句内抽取在标准摘要基准测试中表现与句级抽取相当或更优。
- 人工评估确认,基于子句内单元生成的摘要被认为更精确、更少冗余。
- 使用短语结构解析使模型能够识别出语义连贯且信息丰富的短语。
- 神经网络模型在句法层面选择关键内容时表现出更强的鲁棒性和相关性。
- 结果表明,子句内单元可作为全句抽取的可行且潜在更优的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。