Skip to main content
QUICK REVIEW

[论文解读] TF-IDFC-RF: A Novel Supervised Term Weighting Scheme

Flávio Carvalho, Gustavo Paiva Guedes|arXiv (Cornell University)|Mar 12, 2020
Sentiment Analysis and Opinion Mining参考文献 34被引用 7
一句话总结

该论文提出了一种新型有监督的术语加权方法 TF-IDFC-RF,用于情感分析,通过结合 TF-IDF 和 TF-RF,引入了类别特定的逆文档频率(IDFC)和相关性反馈。在四个二元情感分析数据集上使用 SVM 和朴素贝叶斯进行评估,TF-IDFC-RF 超过了九种现有方法,在两个数据集上取得了最高的 F1 分数,证明了其在 IGM 基方法和传统方法中具有更优的一致性和性能。

ABSTRACT

Sentiment Analysis is a branch of Affective Computing usually considered a binary classification task. In this line of reasoning, Sentiment Analysis can be applied in several contexts to classify the attitude expressed in text samples, for example, movie reviews, sarcasm, among others. A common approach to represent text samples is the use of the Vector Space Model to compute numerical feature vectors consisting of the weight of terms. The most popular term weighting scheme is TF-IDF (Term Frequency - Inverse Document Frequency). It is an Unsupervised Weighting Scheme (UWS) since it does not consider the class information in the weighting of terms. Apart from that, there are Supervised Weighting Schemes (SWS), which consider the class information on term weighting calculation. Several SWS have been recently proposed, demonstrating better results than TF-IDF. In this scenario, this work presents a comparative study on different term weighting schemes and proposes a novel supervised term weighting scheme, named as TF-IDFC-RF (Term Frequency - Inverse Document Frequency in Class - Relevance Frequency). The effectiveness of TF-IDFC-RF is validated with SVM (Support Vector Machine) and NB (Naive Bayes) classifiers on four commonly used Sentiment Analysis datasets. TF-IDFC-RF shows promising results, outperforming all other weighting schemes on two datasets.

研究动机与目标

  • 为解决如 TF-IDF 等无监督术语加权方法在情感分析中的局限性,通过引入类别级别信息。
  • 提出一种新的有监督术语加权方法,通过建模类内和类间术语分布,提升分类准确率。
  • 在四个广泛使用的二分类情感分析数据集上,将 TF-IDFC-RF 与九种现有术语加权方法进行对比评估。
  • 证明 TF-IDFC-RF 在不同分类器(SVM 和朴素贝叶斯)以及不同特征尺寸下的鲁棒性和优越性。
  • 为二元情感分类提供一种一致且高性能的替代方案,优于基于 IGM 和其他最先进有监督加权方法。

提出的方法

  • TF-IDFC-RF 通过将词频(TF)与类别特定的逆文档频率(IDFC)相结合来计算术语权重,其中 IDF 按情感类别分别计算。
  • 该方法引入了 TF-RF 方法的相关性反馈机制,通过强调在相关文档中频繁出现但在其他文档中稀少的术语,增强判别能力。
  • 术语权重计算为 TF 与经过调整的修改版 IDFC 因子的乘积,相关性反馈机制用于放大信息量丰富的术语。
  • 该方法采用向量空间模型,基于术语权重生成数值特征向量,随后使用 SVM 和朴素贝叶斯进行分类。
  • 通过不同特征尺寸(500 至 14,000)进行实验,以评估在不同维度下的性能稳定性。
  • 与两种无监督方法(TF、TF-IDF)和八种有监督方法(包括 TF-RF、TF-IDF-ICF 和基于 IGM 的变体,如 TF-IGM、STF-IGM 等)进行比较。

实验结果

研究问题

  • RQ1将类别特定的 IDF(IDFC)与相关性反馈结合,是否能提升情感分析中的术语加权性能?
  • RQ2在二元情感分类中,TF-IDFC-RF 与最先进的有监督术语加权方法(如 TF-IGM 及其变体)相比表现如何?
  • RQ3TF-IDFC-RF 是否在不同数据集和分类器上比现有基于 IGM 的方法更具一致性?
  • RQ4结合 TF-IDF 和 TF-RF 原理的混合方法是否能超越各自独立组件及其他先进方法?
  • RQ5所提出的方法在不同特征空间大小下是否能保持高性能?

主要发现

  • 在极性(Polarity)和讽刺(Sarcasm)数据集上,TF-IDFC-RF 在 SVM 和朴素贝叶斯分类器下均取得了最高的 F1 分数,优于所有九种对比方法。
  • 在电影评论(Movie Review)数据集上,TF-IDFC-RF 在 14,000 个特征下,SVM 的 F1 分数为 77.01,朴素贝叶斯为 77.17,位列顶尖表现者之列。
  • 在主观性(Subjectivity)数据集上,TF-IDFC-RF 在 14,000 个特征下,SVM 的 F1 分数为 77.02,朴素贝叶斯为 77.05,优于 TF-IDF 和其他方法。
  • 基于 IGM 的方法(如 STF-IGM imp)并未始终优于其他方法;其性能在不同数据集和特征尺寸间波动显著,而 TF-IDFC-RF 表现稳定。
  • TF-RF 在所有数据集和分类器上均表现劣于所有基于 IGM 的方法和 TF-IDFC-RF,与先前声称其优越性的结论相矛盾。
  • TF-IDF 在主观性数据集上表现最佳,但 TF-IDFC-RF 在其余所有数据集上均达到或超过其表现,展现出更广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。