Skip to main content
QUICK REVIEW

[论文解读] Toward Extractive Summarization of Online Forum Discussions via Hierarchical Attention Networks

Sansiri Tarnpradab, Fei Liu|arXiv (Cornell University)|May 25, 2018
Topic Modeling被引用 14
一句话总结

本文提出了一种基于层次注意力网络(HAN)的监督式抽取式摘要方法,用于在线论坛帖子的摘要生成,通过注意力机制学习词和句子级别的表示。该方法在新标注的600个论坛帖子数据集上,于ROUGE和句子级别指标上均优于多个基线模型,其中冗余去除对于实现最先进性能至关重要。

ABSTRACT

Forum threads are lengthy and rich in content. Concise thread summaries will benefit both newcomers seeking information and those who participate in the discussion. Few studies, however, have examined the task of forum thread summarization. In this work we make the first attempt to adapt the hierarchical attention networks for thread summarization. The model draws on the recent development of neural attention mechanisms to build sentence and thread representations and use them for summarization. Our results indicate that the proposed approach can outperform a range of competitive baselines. Further, a redundancy removal step is crucial for achieving outstanding results.

研究动机与目标

  • 为解决由于标注数据有限而导致的论坛帖子摘要缺乏监督方法的问题。
  • 将层次注意力网络(HAN)适配用于建模抽取式摘要中的句子级和帖子级表示。
  • 开发一种监督框架,学习预测哪些句子最相关于帖子的摘要。
  • 评估冗余去除在提升摘要质量方面的有效性。
  • 构建并发布一个包含600个论坛帖子的人工生成摘要的新标注数据集,以支持未来研究。

提出的方法

  • 模型使用双向LSTM结合词级别注意力机制,将每个句子编码为稠密向量,聚焦于关键词语。
  • 随后通过句子级别注意力机制将句子表示进行组合,形成帖子级别的表示。
  • 最终通过分类层基于学习到的帖子表示预测每个句子是否应包含在摘要中。
  • 采用交叉熵损失函数,使用RMSProp优化器和Dropout正则化进行端到端训练。
  • 在后处理阶段应用冗余去除步骤,以消除最终摘要中的重复或近似重复句子。
  • 通过ROUGE和句子级别F1分数,将该方法与无监督(如LexRank、MEAD)和监督(如SVM、LogReg)基线方法进行比较。

实验结果

研究问题

  • RQ1层次注意力网络能否有效建模论坛帖子结构以提升抽取式摘要性能?
  • RQ2所提出的基于HAN的方法与现有无监督和监督摘要方法相比,在论坛帖子摘要上表现如何?
  • RQ3冗余去除对监督模型摘要性能有何影响?
  • RQ4在相关任务上进行预训练是否能提升HAN模型的摘要性能?
  • RQ5在多大程度上,一个规模较小的600个论坛帖子人工标注数据集能够支持有效的监督摘要?

主要发现

  • HAN模型在ROUGE-1和ROUGE-2得分上均优于所有无监督基线模型以及监督SVM和LogReg模型。
  • HAN模型的精确率高于传统方法,表明其在选择相关句子方面表现更优。
  • 冗余去除显著提升了ROUGE和句子级别F1得分的召回率,尤其对HAN模型效果更明显。
  • 对LogReg应用冗余去除仅带来微小增益,表明HAN因基于注意力的句子选择机制,从该步骤中获益更多。
  • 在相关任务上对HAN模型进行预训练并未提升性能,可能由于数据不足和任务不匹配。
  • HAN模型在监督方法中达到了最先进性能,仅MEAD在ROUGE得分上优于该模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。