[论文解读] NILC-USP at SemEval-2017 Task 4: A Multi-view Ensemble for Twitter Sentiment Analysis
本论文提出了一种用于推特情感分析的多视角集成系统,采用三种不同的文本表示方法——带tf-idf加权的词袋模型、平均词嵌入以及加权词嵌入——每种方法均搭配线性分类器(SVM或逻辑回归)。该集成系统在SemEval-2017任务4子任务A(英文)中取得了0.595的F1分数,位列38个系统中的第18名。
This paper describes our multi-view ensemble approach to SemEval-2017 Task 4 on Sentiment Analysis in Twitter, specifically, the Message Polarity Classification subtask for English (subtask A). Our system is a voting ensemble, where each base classifier is trained in a different feature space. The first space is a bag-of-words model and has a Linear SVM as base classifier. The second and third spaces are two different strategies of combining word embeddings to represent sentences and use a Linear SVM and a Logistic Regressor as base classifiers. The proposed system was ranked 18th out of 38 systems considering F1 score and 20th considering recall.
研究动机与目标
- 通过使用多样化的文本表示技术,提升在简短、非正式推特文本中的情感分类性能。
- 评估一种多视角集成方法的有效性,该方法结合不同特征空间而不进行特征融合。
- 评估在噪声较大的社交媒体文本上,使用最小预处理的简单可解释模型(SVM、逻辑回归)的性能。
- 识别现有基于嵌入的方法在处理反语、词序以及非正式语言方面的局限性。
提出的方法
- 该系统采用三种基分类器的软投票集成,每个分类器在不同的文本表示空间上进行训练。
- 第一个分类器使用带tf-idf加权的词袋模型,并采用线性SVM进行分类。
- 第二个分类器将推文表示为预训练Word2Vec嵌入(300维)的平均值,并使用线性SVM。
- 第三个分类器使用加权平均嵌入,其中词的权重来自tf-idf,分类器采用逻辑回归。
- 最终预测通过将三个分类器的预测概率相加,并选择总分最高的类别确定。
- 预处理包括分词(处理URL、提及、数字、表情符号)、转为小写,以及去除停用词、标点符号、井号和用户名。
实验结果
研究问题
- RQ1使用简单、非复杂文本表示的多视角集成能否在推特情感分类中取得有竞争力的性能?
- RQ2不同的文本表示策略——词袋模型、原始词嵌入与tf-idf加权嵌入——如何影响情感分类性能?
- RQ3在非正式社交媒体文本上,跨不同特征空间组合多个分类器是否能比单模型方法提升泛化能力?
- RQ4词序与非正式语言(如缩写、替换)在多大程度上限制了基于嵌入模型的性能?
- RQ5在低资源、噪声较大的推特数据中,仅使用标准分类器的最小化预处理流程能否超越更复杂的模型?
主要发现
- 该系统在SemEval-2017推特2017测试数据集上取得0.595的F1分数,位列38个参赛系统中的第18名。
- 召回率为0.612,在竞赛中排名第20位,表明在识别正面情感样本方面表现相对较强。
- 在SMS2013和Tw2014-sarcasm数据集上表现较差,可能由于词汇差异,且缺乏对词序建模导致无法捕捉反语。
- 在LiveJournal2014数据集上性能保持稳定,表明当数据风格与结构与推特相似时,对领域偏移具有鲁棒性。
- 在词序与否定显著改变情感的句子中表现不佳,例如反语句如“这不是糟糕的,这是完美的”。
- 在非正式语言中未微调或归一化的预训练Word2Vec嵌入限制了在含有大量俚语或缩写的数据集上的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。