Skip to main content
QUICK REVIEW

[论文解读] Are We Really Making Much Progress in Text Classification? A Comparative Review

Lukas Galke, Ansgar Scherp|arXiv (Cornell University)|Apr 8, 2022
Text and Document Classification Technologies被引用 8
一句话总结

本文通过与强基线模型(包括预训练语言模型和宽深层前馈神经网络)对比,对近期的文本分类方法——词袋模型、序列模型、图神经网络模型和层次结构模型——进行了批判性评估。研究发现,大多数新颖的图神经网络和层次结构模型未能超越简单且经过良好调优的基线模型,表明尽管方法论创新层出不穷,但该领域实际进展有限。

ABSTRACT

We analyze various methods for single-label and multi-label text classification across well-known datasets, categorizing them into bag-of-words, sequence-based, graph-based, and hierarchical approaches. Despite the surge in methods like graph-based models, encoder-only pre-trained language models, notably BERT, remain state-of-the-art. However, recent findings suggest simpler models like logistic regression and trigram-based SVMs outperform newer techniques. While decoder-only generative language models show promise in learning with limited data, they lag behind encoder-only models in performance. We emphasize the superiority of discriminative language models like BERT over generative models for supervised tasks. Additionally, we highlight the literature's lack of robustness in method comparisons, particularly concerning basic hyperparameter optimizations like learning rate in fine-tuning encoder-only language models. Data availability: The source code is available at https://github.com/drndr/multilabel-text-clf All datasets used for our experiments are publicly available except the NYT dataset.

研究动机与目标

  • 评估近期文本分类领域的进展,特别是图神经网络和层次结构方法,是否代表了有意义的突破。
  • 将现代文本分类方法的性能与强大且成熟的基线模型(包括预训练语言模型和宽深层前馈神经网络)进行对比评估。
  • 判断当前文本分类领域的基准测试实践是否足够严格,以验证方法论上的宣称。
  • 强调在未来研究中使用强大且先进的基线模型的重要性,以避免高估方法改进的实际效果。
  • 在五个单标签和七个多标签数据集上进行系统性比较,包括新的实证评估。

提出的方法

  • 本研究对单标签和多标签文本分类方法进行了全面的文献综述,将它们归类为词袋模型、序列模型、图神经网络模型和层次结构模型四类。
  • 整合了文献中报告的12个基准数据集(5个单标签,7个多标签)的性能结果,并通过新增实验确保结果的一致性和公平性。
  • 采用具备现代训练方法的宽深层前馈神经网络(WideMLP)作为强词袋模型基线,其输入为TF-IDF或词频向量表示。
  • 将这些基线模型与预训练语言模型(如BERT、RoBERTa)以及新型图神经网络模型(如TextGCN、HeteGCN、HBGL)进行对比。
  • 对于层次结构模型,评估了如HBGL等将类别层次信息整合到预训练模型中的模型。
  • 评估使用标准指标(如F1、准确率),并确保所有方法在训练-测试划分、数据预处理和超参数调优方面保持一致。

实验结果

研究问题

  • RQ1近期提出的图神经网络文本分类方法是否显著优于SVM等成熟基线模型或宽深层前馈神经网络?
  • RQ2具备层次感知能力的模型是否能在文本分类任务中超越微调后的预训练语言模型?
  • RQ3当前文本分类领域的基准测试实践在多大程度上掩盖了新方法的真实性能?
  • RQ4预训练语言模型是否仍然是当前最先进模型,还是专用架构能带来可测量的性能提升?
  • RQ5基于MLP的序列模型(如gMLP、aMLP)在大规模文本数据上进行预训练后,是否具备与主流模型竞争的能力?

主要发现

  • 在所评估的数据集中,近期提出的图神经网络或层次结构模型均未在整体上显著超越微调后的预训练语言模型。
  • 许多图神经网络模型的表现甚至不如基于词袋特征、经良好调优的深层前馈神经网络,表明实际出现了倒退而非进步。
  • 采用现代训练方法的宽深层前馈神经网络(WideMLP)在最具挑战性的多标签数据集上达到了最先进性能,甚至优于部分预训练模型。
  • 只有将类别层次信息整合到预训练Transformer模型中的模型(如HBGL)才在整体上持续优于纯预训练模型。
  • 研究结果确认,预训练语言模型依然是最先进水平,其他架构家族在所有基准测试中均未展现出全面超越的表现。
  • 结果表明,当前的研究实践往往未能包含足够强的基线模型,导致对方法论进步的高估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。