Skip to main content
QUICK REVIEW

[论文解读] Inverse-Category-Frequency Based Supervised Term Weighting Schemes for Text Categorization *

Deqing Wang, Hui Zhang|arXiv (Cornell University)|Mar 1, 2013
Text and Document Classification Technologies参考文献 34被引用 67
一句话总结

本文提出了两种新颖的有监督词加权方案——tf.icf 和基于 icf 的方法,通过用逆类别频率(icf)替代传统的逆文档频率(idf),优先考虑在类别中稀少的词而非文档中稀少的词。实验结果表明,这两种方法在多种分类器和语料库上,于宏平均 F1 和微平均 F1 指标上均优于或匹配六种有监督方案和三种传统方案。

ABSTRACT

Term weighting schemes often dominate the performance of many classifiers, such as kNN, centroid-based classifier and SVMs. The widely used term weighting scheme in text categorization, i.e., tf.idf, is originated from information retrieval (IR) field. The intuition behind idf for text categorization seems less reasonable than IR. In this paper, we introduce inverse category frequency (icf) into term weighting scheme and propose two novel approaches, i.e., tf.icf and icf-based supervised term weighting schemes. The tf.icf adopts icf to substitute idf factor and favors terms occurring in fewer categories, rather than fewer documents. And the icf-based approach combines icf and relevance frequency (rf) to weight terms in a supervised way. Our cross-classifier and cross-corpus experiments have shown that our proposed approaches are superior or comparable to six supervised term weighting schemes and three traditional schemes in terms of macro-F1 and micro-F1.

研究动机与目标

  • 为解决 tf.idf 在文本分类中的局限性,即 idf 关注文档稀有性,而类别稀有性更为合适。
  • 探究逆类别频率(icf)是否能更好地反映有监督文本分类中词的判别能力。
  • 开发结合 icf 与相关性频率(rf)的有监督词加权方案,以提升分类性能。
  • 在多种分类器和语料库上评估所提方案,以确保其泛化能力和鲁棒性。

提出的方法

  • 提出 tf.icf,一种词加权方案,用 icf 替代 idf,偏好出现在更少类别中的词,而非更少文档中的词。
  • 引入基于 icf 的有监督词加权方案,将 icf 与相关性频率(rf)结合,其中 rf 衡量词在相关类别中的频率。
  • 使用公式 icf = log(C / N_c),其中 C 为类别总数,N_c 为包含该词的类别数。
  • 在 kNN、基于中心的和 SVM 分类器中应用加权词,以评估不同学习范式下的性能。
  • 采用跨分类器和跨语料库的评估方法,验证所提方案的鲁棒性。
  • 使用宏平均 F1 和微平均 F1 作为指标,将所提方法与六种有监督和三种传统词加权方案进行比较。

实验结果

研究问题

  • RQ1在有监督设置下,用 icf 替代 idf 是否能提升词加权在文本分类中的性能?
  • RQ2icf 与相关性频率(rf)的结合相较于现有有监督词加权方案表现如何?
  • RQ3所提方案是否在不同分类器和文本语料库上具有泛化能力?
  • RQ4在宏平均 F1 和微平均 F1 指标上,tf.icf 和基于 icf 的方案是否优于或等同于已有的词加权方法?

主要发现

  • tf.icf 方案在宏平均 F1 和微平均 F1 指标上优于或等同于六种有监督和三种传统词加权方案。
  • 基于 icf 的有监督词加权方案在多种分类器和语料库上实现了更优或相当的性能。
  • 使用 icf(强调类别稀有性)相比基于文档的 idf,能实现更优的判别性词选择。
  • 跨分类器和跨语料库实验验证了所提词加权方案的鲁棒性和泛化能力。
  • 结果表明,基于 icf 的加权方法在类别层面判别力至关重要的场景中尤为有效。
  • 所提方法在宏平均 F1 和微平均 F1 上均表现出一致的提升,表明在所有类别上性能均衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。