Skip to main content
QUICK REVIEW

[论文解读] Disentangling Aspect and Opinion Words in Target-based Sentiment Analysis using Lifelong Learning

Shuai Wang, Mianwei Zhou|arXiv (Cornell University)|Feb 16, 2018
Sentiment Analysis and Opinion Mining参考文献 20被引用 7
一句话总结

本文提出一种终身PU学习(LPU)框架,用于在基于目标的情感分析中解耦与目标相关的词、观点词与方面词,采用两阶段方法:首先通过语义相似度对与目标相关的词进行分组,然后应用迭代PU学习并结合终身知识积累,以减少错误阳性结果的传播。该方法在无需人工标注的情况下,实现了细粒度情感分析的优越性能。

ABSTRACT

Given a target name, which can be a product aspect or entity, identifying its aspect words and opinion words in a given corpus is a fine-grained task in target-based sentiment analysis (TSA). This task is challenging, especially when we have no labeled data and we want to perform it for any given domain. To address it, we propose a general two-stage approach. Stage one extracts/groups the target-related words (call t-words) for a given target. This is relatively easy as we can apply an existing semantics-based learning technique. Stage two separates the aspect and opinion words from the grouped t-words, which is challenging because we often do not have enough word-level aspect and opinion labels. In this work, we formulate this problem in a PU learning setting and incorporate the idea of lifelong learning to solve it. Experimental results show the effectiveness of our approach.

研究动机与目标

  • 解决在低资源或零样本领域中,由于人工标注不可行,细粒度基于目标的情感分析(FTSA)所面临的挑战。
  • 在仅提供目标名称且无词级别标注的情况下,将与目标相关的方面词与观点词分离。
  • 通过整合终身学习原则,迭代优化正样本选择,以克服PU学习中的错误传播问题。
  • 开发一种可泛化的无监督或弱监督方法,适用于电子、美妆和音频设备等多种领域。

提出的方法

  • 该方法采用两阶段流程:首先使用分布语义模型(如词嵌入或主题模型)提取与目标相关的词(t-words)。
  • 在第二阶段,将t-方面词与t-观点词的解耦问题建模为PU学习问题,将通用观点词作为初始正样本。
  • 所提出的LPU模型通过在迭代过程中累积知识,整合了终身学习机制,并利用约束条件防止错误阳性传播。
  • 该算法通过选择高置信度预测结果,迭代更新正样本集,同时应用置信度阈值和约束机制,以避免错误漂移。
  • 该方法在多个领域(如手机、美妆)上使用真实世界评论语料进行评估,以LDA和词嵌入作为初始t-词提取器。
  • 消融研究对比了LPU与标准PU学习、朴素迭代PU以及非迭代模型,证明了终身学习整合的优越性。

实验结果

研究问题

  • RQ1在无标注数据的情况下,PU学习方法能否有效从与目标相关的词中解耦方面词与观点词?
  • RQ2错误阳性预测导致的错误传播在该解耦任务中如何影响PU学习的性能?
  • RQ3在该背景下,整合终身学习原则在多大程度上提升了PU学习的鲁棒性与准确性?
  • RQ4所提出方法在消费电子与美妆产品等不同领域中的泛化能力如何?

主要发现

  • LPU在识别正确观点词方面显著优于标准PU学习和迭代PU基线模型,尤其在检测非形容词观点词(如'muddiness'和'sibilance')方面表现突出。
  • 模型(c)——将新预测结果与初始词典结合但无约束条件——未能学习到新正样本,表明其适应能力差且知识积累有限。
  • 模型(b)——将所有新预测结果朴素地重新用作正样本——因错误传播而出现严重问题,错误地将方面词(如'sound'和'volume')分类为观点词。
  • 如图3所示,LPU在150次迭代中表现出稳定且高性能,平均准确率持续提升。
  • 该方法成功识别出ADJ和NLL等模型所遗漏的非形容词观点词(如'muddiness'和'thumping'),展现出更广的覆盖范围。
  • 在主题建模(LDA)设置下,LPU仍保持强劲性能,表明其与不同t-词提取技术具有良好的兼容性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。