[论文解读] Sentiment Analysis on Financial News Headlines using Training Dataset Augmentation
该论文提出UW-FinSent,一种用于金融新闻标题情感分析的系统,通过使用单字和双字n-gram结合简单线性回归,从-1(看空)到1(看多)预测连续情感得分。尽管尝试了TF-IDF和Doc2Vec等高级方法,最简单的模型仍取得了最佳性能,在SemEval-2017测试集上达到0.644的余弦相似度得分,表明在低数据金融NLP场景中,基础向量化方法与回归模型优于复杂模型。
This paper discusses the approach taken by the UWaterloo team to arrive at a solution for the Fine-Grained Sentiment Analysis problem posed by Task 5 of SemEval 2017. The paper describes the document vectorization and sentiment score prediction techniques used, as well as the design and implementation decisions taken while building the system for this task. The system uses text vectorization models, such as N-gram, TF-IDF and paragraph embeddings, coupled with regression model variants to predict the sentiment scores. Amongst the methods examined, unigrams and bigrams coupled with simple linear regression obtained the best baseline accuracy. The paper also explores data augmentation methods to supplement the training dataset. This system was designed for Subtask 2 (News Statements and Headlines).
研究动机与目标
- 开发一种在有限训练数据下对金融新闻标题进行细粒度情感分析的稳健系统。
- 评估不同文本向量化技术(n-gram、TF-IDF、段落向量)在情感得分预测中的有效性。
- 探索使用外部金融和非领域情感数据集进行数据增强策略,以提升模型泛化能力。
- 确定在金融情感任务中,简单模型(如线性回归)是否优于复杂模型(如XGBoost或SVR)。
- 为SemEval-2017的子任务2建立基线系统,重点是-1到1之间的连续情感得分预测。
提出的方法
- 文本预处理包括将组织名称替换为通用占位符,以降低特征空间复杂度。
- 通过scikit-learn的CountVectorizer实现单字和双字n-gram向量化,以捕捉局部词序模式。
- 同时评估了TF-IDF和Doc2Vec(通过Gensim实现)作为替代文本表示方法。
- 训练了三种回归模型:简单线性回归、支持向量回归(SVR)和XGBoost线性回归。
- 使用R²和余弦相似度得分评估模型性能,后者为SemEval官方指标。
- 尝试使用Financial Phrasebank和大规模IMDB类数据集进行数据增强,但未观察到性能提升。
实验结果
研究问题
- RQ1使用单字和双字n-gram结合简单线性回归是否在金融情感分析中优于更复杂的模型(如SVR或XGBoost)?
- RQ2能否有效利用外部情感数据集(如Financial Phrasebank或IMDB)来增强有限的金融训练数据?
- RQ3在预测连续情感得分时,n-gram、TF-IDF和段落向量等不同文本向量化技术有何对比表现?
- RQ4超参数调优对Doc2Vec在金融新闻标题情感预测中的性能有何影响?
- RQ5为何在低数据环境下,简单模型(如线性回归)的表现优于深度学习或集成方法?
主要发现
- 单字和双字n-gram与简单线性回归的组合在试验数据集上取得了最高的R²得分0.38。
- 同一配置在SemEval-2017测试集上实现了最佳余弦相似度得分0.644,优于所有其他模型组合。
- TF-IDF和SVR的R²得分相近(均为0.38),但余弦相似度较低(0.63),表明与真实标签的相关性不够一致。
- Doc2Vec模型表现较差,R²得分为-4.69,余弦相似度仅为0.04,表明在该任务上泛化能力差。
- XGBoost回归模型在所有指标上均表现欠佳,R²仅为0.21,余弦相似度为0.50。
- 使用外部金融和非领域数据集进行数据增强未能提升模型性能,交叉验证准确率无显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。