Skip to main content
QUICK REVIEW

[论文解读] Query-Focused Opinion Summarization for User-Generated Content

Lu Wang, Hema Raghavan|arXiv (Cornell University)|Jun 17, 2016
Topic Modeling参考文献 30被引用 13
一句话总结

本文提出了一种基于子模函数的框架,用于用户生成内容中的查询聚焦意见摘要,整合了统计相关性排序、通过LDA实现的主题覆盖以及通过分散函数实现的多样性。该框架在自动评估(ROUGE、Pyramid F1)和人工评估中均优于最先进方法,在TAC-2008数据集上实现了57.1%的人工偏好率,ROUGE-2得分达到0.3234,Pyramid F1得分达到0.3620。

ABSTRACT

We present a submodular function-based framework for query-focused opinion summarization. Within our framework, relevance ordering produced by a statistical ranker, and information coverage with respect to topic distribution and diverse viewpoints are both encoded as submodular functions. Dispersion functions are utilized to minimize the redundancy. We are the first to evaluate different metrics of text similarity for submodularity-based summarization methods. By experimenting on community QA and blog summarization, we show that our system outperforms state-of-the-art approaches in both automatic evaluation and human evaluation. A human evaluation task is conducted on Amazon Mechanical Turk with scale, and shows that our systems are able to generate summaries of high overall quality and information diversity.

研究动机与目标

  • 通过生成针对特定查询的简洁、多样化的意见摘要,缓解用户生成内容中的信息过载问题。
  • 通过整合学习得到的句子相关性、主题覆盖和冗余减少,提升摘要质量。
  • 评估不同文本相似性度量方法对子模摘要性能的影响。
  • 在社区问答和博客数据上,通过自动评估和人工评估,证明该框架的优越性。

提出的方法

  • 该框架使用子模目标函数,结合相关性(通过学习的统计排序器实现)、主题覆盖(通过LDA实现)和多样性(通过分散函数实现)。
  • 相关性通过基于ListNet的排序器建模,该排序器根据查询相关性和主观性特征对句子进行打分。
  • 通过在Yahoo! Answers上使用100个主题、在TAC-2008上使用40个主题的LDA,捕捉主题覆盖,实现在摘要中多样化主题的表示。
  • 通过选择句子之间的成对距离之和或最小值,利用分散函数最小化冗余。
  • 评估了文本相似性度量方法——词汇级(TF-IDF)、语义级(WordNet)和主题级(LDA)——对多样性和覆盖度的影响。
  • 采用贪心算法优化子模目标函数,确保可扩展性和近似最优性能。

实验结果

研究问题

  • RQ1与n-gram重叠相比,整合学习得到的句子相关性在查询聚焦意见摘要中能多大程度提升性能?
  • RQ2在最小化冗余和最大化多样性方面,分散函数与相似性度量的最佳组合是什么?
  • RQ3不同文本相似性度量方法(词汇级、语义级、主题级)如何影响子模摘要的质量?
  • RQ4所提出的框架是否在自动评估和人工评估中均优于最先进方法?

主要发现

  • 在TAC-2008博客数据集上,该系统ROUGE-2得分为0.3234,显著优于最佳TAC’08系统(0.2923)和所有基线方法(p < 0.05)。
  • 在Amazon Mechanical Turk上的人工评估中,该系统被偏好57.1%的时间,远高于Yahoo!用户选择的最佳答案的31.9%。
  • Pyramid F1得分为0.3620,显著高于最佳TAC’08系统(0.2225)和次佳基线方法(0.2790)。
  • 基于TF-IDF的相似性度量在内容覆盖和多样性度量方面始终优于基于WordNet的语义相似性度量。
  • 在分散函数方面,距离之和函数(h_sum)在Yahoo! Answers上优于最小距离函数(h_min),而h_min在TAC-2008上表现更优,表明最优设计具有领域依赖性。
  • 在博客数据上,主题相似性略优于词汇和语义度量方法,表明主题建模可增强长篇内容中的多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。