Skip to main content
QUICK REVIEW

[论文解读] An Unsupervised Approach for Aspect Category Detection Using Soft Cosine Similarity Measure

Erfan Ghadery, Sajad Movahedi|arXiv (Cornell University)|Dec 8, 2018
Sentiment Analysis and Opinion Mining被引用 5
一句话总结

该论文提出了一种无监督方法,通过在未标注的评论句子上使用软余弦相似度和k-means聚类进行情感方面类别检测,无需标注数据或特征工程。该方法在SemEval-2014餐厅数据集上取得了76.98%的F1分数,显著优于现有的无监督和有监督基线方法。

ABSTRACT

Aspect category detection is one of the important and challenging subtasks of aspect-based sentiment analysis. Given a set of pre-defined categories, this task aims to detect categories which are indicated implicitly or explicitly in a given review sentence. Supervised machine learning approaches perform well to accomplish this subtask. Note that, the performance of these methods depends on the availability of labeled train data, which is often difficult and costly to obtain. Besides, most of these supervised methods require feature engineering to perform well. In this paper, we propose an unsupervised method to address aspect category detection task without the need for any feature engineering. Our method utilizes clusters of unlabeled reviews and soft cosine similarity measure to accomplish aspect category detection task. Experimental results on SemEval-2014 restaurant dataset shows that proposed unsupervised approach outperforms several baselines by a substantial margin.

研究动机与目标

  • 解决在标注训练数据稀缺或不可用的低资源环境下方面类别检测的挑战。
  • 消除在基于方面的情感分析中对昂贵且耗时的手动标注训练数据的依赖。
  • 通过利用词嵌入和语义相似度度量,减少对手工设计特征的依赖。
  • 开发一种鲁棒且参数高效的无监督方法,使其在不同评论句子间具有良好泛化能力。

提出的方法

  • 为每个方面类别手动选择5个种子词(例如,'food'、'service')来表示该类别,但排除'anecdotes/miscellaneous'类别,因其具有抽象性质。
  • 使用预训练的词嵌入,并计算每条评论句子的平均词嵌入以表示其语义内容。
  • 应用k-means聚类,基于句子平均词嵌入之间的欧几里得距离对句子进行分组,形成k个聚类。
  • 计算测试句子与每个类别种子词之间的软余弦相似度,以确定句子与类别的相似度得分。
  • 计算聚类与类别的相似度,即该聚类中所有句子与类别种子词之间软余弦相似度的平均值。
  • 使用学习得到的插值系数α,将句子的类别得分与最近聚类的得分进行插值,然后进行归一化并应用阈值以完成最终的类别预测。

实验结果

研究问题

  • RQ1无监督方法是否能在不依赖标注训练数据的情况下实现有竞争力的方面类别检测性能?
  • RQ2在未进行显式特征工程的情况下,软余弦相似度在捕捉句子与方面类别之间语义关系方面的有效性如何?
  • RQ3与仅使用句子级相似度相比,对未标注句子进行聚类在多大程度上提升了方面类别的检测效果?
  • RQ4在准确类别预测中,句子级与聚类级相似度得分之间最优平衡点是什么?

主要发现

  • 所提出的无监督方法在SemEval-2014餐厅数据集上取得了76.98%的F1分数,显著优于最佳现有无监督基线方法(Spreading Activation)9.98个百分点。
  • 尽管是无监督方法,该方法在F1分数上仍比SemEval-2014的有监督基线高出13.08个百分点,表现出强劲性能。
  • 超参数调优表明,插值系数α = 0.7且k = 17个聚类时性能最优,超出此范围后性能下降。
  • 该方法对聚类大小变化具有鲁棒性,最优结果在k = 17时取得,表明聚类凝聚性与一致性之间达到了良好平衡。
  • 使用软余弦相似度即使在句子中不包含确切种子词的情况下,也能有效检测方面类别,因其能捕捉语义相似度。
  • 句子级与聚类级得分的插值显著提升了分类准确率,证实聚类级上下文能增强单个句子的预测性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。