Skip to main content
QUICK REVIEW

[论文解读] Data Selection Strategies for Multi-Domain Sentiment Analysis

Sebastian Ruder, Parsa Ghaffari|arXiv (Cornell University)|Feb 8, 2017
Sentiment Analysis and Opinion Mining参考文献 18被引用 9
一句话总结

本文提出了一种新颖的多领域情感分析数据选择策略,通过利用自编码器表征和子集级别选择,优于随机和平衡基线方法。结果表明,代理 $π$-距离和基于自编码器的相似性度量显著提升了性能,尤其在大规模评论数据集上表现突出,且子集级别选择始终优于实例级别方法。

ABSTRACT

Domain adaptation is important in sentiment analysis as sentiment-indicating words vary between domains. Recently, multi-domain adaptation has become more pervasive, but existing approaches train on all available source domains including dissimilar ones. However, the selection of appropriate training data is as important as the choice of algorithm. We undertake -- to our knowledge for the first time -- an extensive study of domain similarity metrics in the context of sentiment analysis and propose novel representations, metrics, and a new scope for data selection. We evaluate the proposed methods on two large-scale multi-domain adaptation settings on tweets and reviews and demonstrate that they consistently outperform strong random and balanced baselines, while our proposed selection strategy outperforms instance-level selection and yields the best score on a large reviews corpus.

研究动机与目标

  • 为解决在情感分析中跨多个领域选择相关训练数据的挑战,特别是在领域定义不明确或未知的情况下。
  • 研究不同表征、相似性度量和选择层级对多领域适应性能的影响。
  • 开发一种优于实例级别选择且在领域边界模糊的真实世界设置中具有鲁棒性的数据选择方法。
  • 为自然语言处理从业者提供在情感分析中有效数据选择的实用指导。

提出的方法

  • 提出三种新颖的数据选择表征:词项分布、词嵌入和自编码器表征,其中自编码器在大规模数据集上表现更优。
  • 引入三种领域相似性度量:Jensen-Shannon 散度、余弦相似度和代理 $π$-距离,后者始终优于默认度量。
  • 采用三种数据选择层级:领域级别、实例级别和子集级别,其中子集级别选择展现出最强的性能提升。
  • 在两个大规模数据集(推文和产品评论)上应用多领域适应框架,评估不同目标领域的性能表现。
  • 采用基于蒸馏的模型训练策略,以利用源领域知识,增强泛化能力。
  • 在不同规模的训练数据下评估选择策略,以检验其可扩展性和鲁棒性。

实验结果

研究问题

  • RQ1不同表征(词项分布、词嵌入、自编码器)在多领域情感分析中的数据选择性能有何影响?
  • RQ2在 Jensen-Shannon 散度、余弦相似度和代理 $π$-距离中,哪种领域相似性度量能实现最有效的数据选择?
  • RQ3在多领域情感分析中,子集级别数据选择是否优于实例级别或领域级别选择?
  • RQ4数据选择性能如何随训练数据规模和领域相似度变化?
  • RQ5在真实世界中领域边界模糊的设置下,自动数据选择能否超越人工标注的领域选择?

主要发现

  • 自编码器表征显著优于词项分布和词嵌入,尤其在大规模评论数据集上,归因于其更丰富的语义建模能力。
  • 子集级别数据选择始终优于实例级别选择,且在训练数据增加时,LiveJournal2014 领域的性能提升最为显著。
  • 代理 $π$-距离始终优于默认相似性度量,表明分类器置信度是领域适应能力的强代理指标。
  • 在评论语料上,所提出的基于自编码器的子集级别选择方法取得了最高准确率,优于所有基线方法和先前方法。
  • 词嵌入在嘈杂的社交媒体数据(推文)上表现欠佳,表明其在低资源或噪声较大的领域中效用有限。
  • 即使在领域无法明确分离的情况下,该方法依然有效,验证了其在真实世界模糊场景下的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。