Skip to main content
QUICK REVIEW

[论文解读] Using Argument-based Features to Predict and Analyse Review Helpfulness

Haijing Liu, Yang Gao|arXiv (Cornell University)|Jul 23, 2017
Sentiment Analysis and Opinion Mining参考文献 18被引用 5
一句话总结

本文提出基于论据的特征——如论辩句比例和证据-结论比例——以提升对有用产品评论的识别能力。基于对110篇酒店评论的人工标注论据结构,作者表明将这些特征与当前最先进的基线方法结合后,F1得分平均提升11.01%,证明了其在论辩视角下捕捉评论有用性的有效性与互补性。

ABSTRACT

We study the helpful product reviews identification problem in this paper. We observe that the evidence-conclusion discourse relations, also known as arguments, often appear in product reviews, and we hypothesise that some argument-based features, e.g. the percentage of argumentative sentences, the evidences-conclusions ratios, are good indicators of helpful reviews. To validate this hypothesis, we manually annotate arguments in 110 hotel reviews, and investigate the effectiveness of several combinations of argument-based features. Experiments suggest that, when being used together with the argument-based features, the state-of-the-art baseline features can enjoy a performance boost (in terms of F1) of 11.01\% in average.

研究动机与目标

  • 探究基于论据的特征是否能提升对有用产品评论的识别能力。
  • 对110篇酒店评论的人工标注论据结构,以建立用于基于论据特征分析的黄金标准数据集。
  • 评估基于论据的特征在与现有内在特征和外部特征对比下的有用性预测有效性。
  • 通过分析最具信息量的基于论据的特征,提供对何为有用评论的解释性洞察。
  • 探索未来工作中使用自动提取论据的潜力,以实现可扩展的有用性检测。

提出的方法

  • 使用七类论据组件方案对110篇酒店评论进行人工标注:主要主张、主张、前提、支持隐含主张的前提(PSIC)、背景、建议和非论据性内容。
  • 在三种粒度上计算基于论据的特征:词符级(例如,组件对之间词符数量的比例)、字母级(例如,字母数量的比例)和位置级(例如,组件顺序与分布)。
  • 将基于论据的特征与四种当前最先进的基线特征集(UGR、STR、GALC和INQUIRER)结合。
  • 使用F1得分和AUC评估性能,并通过配对t检验进行显著性检验。
  • 使用信息增益排序识别对有用性预测最具有效性的基于论据的特征。
  • 应用Fleiss’ Kappa评估标注者间一致性,确认标注质量较高(kappa > 0.6)。

实验结果

研究问题

  • RQ1基于论据的特征是否能在现有最先进的特征基础上进一步提升有用评论检测的性能?
  • RQ2哪些具体的基于论据的特征对识别有用评论贡献最大?
  • RQ3论据的结构与长度(例如前提数量、组件顺序)如何与评论有用性相关联?
  • RQ4基于论据的特征在多大程度上提供了其他内在或外部特征未捕捉到的互补信息?
  • RQ5基于论据特征的粒度(词符、字母、位置、组件级别)如何影响其预测能力?

主要发现

  • 将基于论据的特征与当前最先进的基线结合后,F1得分平均提升11.01%,AUC提升10.40%。
  • 词符级和字母级的基于论据的特征对有用性预测贡献最大,分别占最具信息量特征的36%和29%,表明评论长度与结构是关键指标。
  • 论据组件之间词符和字母数量的比例(例如前提与主张的比例)最具信息量,表明平衡且详尽的论辩结构能增强有用性。
  • 位置级特征(捕捉论据组件的顺序与逻辑流)贡献了25%最具信息量的特征,凸显了逻辑结构在感知有用性中的作用。
  • 组件级特征仅贡献了10%最具信息量的特征,表明其提供的区分能力低于更细粒度的特征。
  • 当单独使用时,基于论据的特征优于STR、GALC和INQUIRER,且在性能上仅次于UGR,尽管UGR存在高维与稀疏性问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。