Skip to main content
QUICK REVIEW

[论文解读] A Novel Two-stage Framework for Extracting Opinionated Sentences from News Articles

Rajkumar Pujari, Swara Desai|arXiv (Cornell University)|Jan 24, 2021
Sentiment Analysis and Opinion Mining参考文献 25被引用 9
一句话总结

本文提出了一种新颖的两阶段框架,通过结合朴素贝叶斯分类器进行初始打分与HITS算法以利用全局句子关系,从新闻文章中提取带有观点的句子。该方法显著提升了基线分类器的精确率,P@3得分为0.72,M@3得分为1.5,同时揭示了文章中观点及其支持性事实的潜在结构组织。

ABSTRACT

This paper presents a novel two-stage framework to extract opinionated sentences from a given news article. In the first stage, Naive Bayes classifier by utilizing the local features assigns a score to each sentence - the score signifies the probability of the sentence to be opinionated. In the second stage, we use this prior within the HITS (Hyperlink-Induced Topic Search) schema to exploit the global structure of the article and relation between the sentences. In the HITS schema, the opinionated sentences are treated as Hubs and the facts around these opinions are treated as the Authorities. The algorithm is implemented and evaluated against a set of manually marked data. We show that using HITS significantly improves the precision over the baseline Naive Bayes classifier. We also argue that the proposed method actually discovers the underlying structure of the article, thus extracting various opinions, grouped with supporting facts as well as other supporting opinions from the article.

研究动机与目标

  • 为解决在新闻文章中识别带有观点的句子的挑战,这些句子的观点表达不如产品评论或论坛中那样明显。
  • 通过利用文章的全局结构,提升基线分类器方法在观点句子抽取中的精确率。
  • 开发一种不仅能够抽取观点句子,还能揭示其支持性事实和基于观点的上下文的方法。
  • 引入一种新的评估指标,重点关注在结果顶部中观点句子的比例相对于其在整篇文章中比例的相对关系。
  • 支持实际应用,如生成讨论问题或追踪媒体覆盖随时间的演变。

提出的方法

  • 在第一阶段,朴素贝叶斯分类器基于局部特征为每个句子分配一个先验概率得分,表示其为观点句子的可能性。
  • 在第二阶段,将HITS(超链接诱导主题搜索)算法应用于文章的句子图,将观点句子视为枢纽,其支持的事实或观点句子视为权威。
  • HITS算法通过以下公式迭代更新枢纽与权威得分:$ H_i^{(k+1)} = \sum_{j \in \text{links to } i} A_j^{(k)} $ 与 $ A_i^{(k+1)} = \sum_{j \in \text{links from } i} H_j^{(k)} $,其中链接由语义相似度与依存句法分析确定。
  • 系统使用依存句法分析与词汇特征(例如极性词语、副词修饰语)来计算句子之间的相似度与链接权重。
  • 一个网络界面通过高亮显示观点句子(黄色)、支持性事实(紫色)和极性词语(绿色/红色)来可视化结果,并展示枢纽-权威结构图。
  • 该方法引入了一种新颖的评估指标,强调在顶部结果中观点句子比例相对于其在文章整体中比例的相对表现。

实验结果

研究问题

  • RQ1结合局部分类与全局结构分析的两阶段框架,能否提升新闻文章中观点句子抽取的精确率?
  • RQ2当HITS算法应用于句子级关系时,相较于基线分类器,其在提升观点句子排序质量方面表现如何?
  • RQ3所提出的方法在多大程度上揭示了新闻文章中观点及其支持性事实的潜在结构组织?
  • RQ4所提出的评估指标(强调基于比例的性能)相较于标准指标(如P@3或M@3)是否更能反映实际应用中的实用性?
  • RQ5枢纽-权威结构能否被用于提升观点多样性,并支持媒体情感随时间演变的纵向追踪?

主要发现

  • 两阶段框架相较于基线朴素贝叶斯分类器显著提升了精确率,P@3提升35.8%,M@3提升30.8%。
  • 系统达到P@3得分为0.72,M@3得分为1.5,表明平均而言,返回的前3个句子中有2个是观点句子。
  • 基于HITS的优化步骤通过利用全局句子关系,有效重新排序观点句子,即使初始朴素贝叶斯得分与HITS结果高度相关。
  • 该方法不仅能成功识别观点句子,还能识别其支持的事实与观点性上下文,揭示文章的潜在结构组织。
  • 错误分析显示,模型偶尔会将包含多个极性词语或强依存结构的陈述性句子误分类为观点句子,表明需要更精细的特征工程。
  • 网络界面通过可视化观点聚类、支持性事实与极性词语标注,展示了实际可用性,使编辑能够快速识别具有讨论价值的内容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。