Skip to main content
QUICK REVIEW

[论文解读] Transformers are Short Text Classifiers: A Study of Inductive Short Text Classifiers on Benchmarks and Real-world Datasets

Fabian Karl, Ansgar Scherp|arXiv (Cornell University)|Nov 30, 2022
Topic Modeling被引用 8
一句话总结

本文研究了Transformer模型(特别是BERT和RoBERTa)在短文本分类任务上的表现,将其与专门针对短文本设计的模型进行对比。结果表明,纯Transformer模型在基准数据集和真实世界数据集上均达到了最先进(SOTA)的准确率,挑战了在短文本任务中使用领域特定架构的必要性。

ABSTRACT

Short text classification is a crucial and challenging aspect of Natural Language Processing. For this reason, there are numerous highly specialized short text classifiers. However, in recent short text research, State of the Art (SOTA) methods for traditional text classification, particularly the pure use of Transformers, have been unexploited. In this work, we examine the performance of a variety of short text classifiers as well as the top performing traditional text classifier. We further investigate the effects on two new real-world short text datasets in an effort to address the issue of becoming overly dependent on benchmark datasets with a limited number of characteristics. Our experiments unambiguously demonstrate that Transformers achieve SOTA accuracy on short text classification tasks, raising the question of whether specialized short text techniques are necessary.

研究动机与目标

  • 评估最先进Transformer模型在短文本分类任务中的有效性。
  • 将基于图神经网络(GNN)、RNN、CNN等的专用短文本模型与通用Transformer模型进行比较。
  • 提出两个新的真实世界数据集——NICE和STOPS,其动机分别来自税务审计和电子商务应用场景。
  • 评估当前基准数据集是否足以评估模型的鲁棒性和泛化能力。
  • 挑战“专用模型对短文本分类是必要的”这一假设。

提出的方法

  • 评估了多种模型,包括BERT、RoBERTa、DistilBERT、ALBERTv2以及图神经网络(如InducT-GCN、SHINE、ConTextING-RoBERTa)。
  • 在短文本数据集(包括R8、Snippets、Twitter、TREC和MR)上采用标准微调协议对Transformer模型进行评估。
  • 引入了两个新的真实世界数据集:NICE(45类商品/服务分类)和STOPS(来自Amazon和Yelp的产品/服务描述)。
  • 在基准数据集和新真实世界数据集上均开展实验,以评估模型的泛化能力和鲁棒性。
  • 对GNN模型(如SHINE、InducT-GCN)报告了多次运行的结果,以应对因随机初始化导致的高方差问题。
  • 以准确率为首要指标,比较不同数据集上的模型性能,并报告参数量以支持模型效率分析。

实验结果

研究问题

  • RQ1与专用短文本模型相比,预训练Transformer模型是否在短文本分类任务中实现了最先进性能?
  • RQ2Transformer模型在具有复杂、领域特定特征(标准基准中未体现)的真实世界短文本数据集上表现如何?
  • RQ3NICE数据集是否足够具有挑战性,可作为未来短文本分类研究的可靠基准?
  • RQ4尽管存在架构差异,通用Transformer模型是否仍能超越GNN或RNN等专用架构在短文本分类任务中的表现?
  • RQ5模型超参数和参数量在多大程度上影响短文本分类任务的性能?

主要发现

  • Transformer模型,特别是RoBERTa和DeBERTa,在所有基准数据集(包括R8、Snippets、Twitter和TREC)上均实现了最先进准确率。
  • 即使参数量更小的模型如DistilBERT(6600万参数)和ALBERTv2(1200万参数)也优于更大的词袋(BoW)基模型(如WideMLP,3130万参数)。
  • NICE-45数据集对所有模型均表现出显著挑战性,表明其作为未来研究稳健基准的价值。
  • 基于图的模型(如ConTextING-RoBERTa和InducT-GCN)表现具有竞争力,但未能超越纯Transformer模型。
  • SHINE在不同运行中表现出显著的性能波动,凸显了GNN在短文本场景下的不稳定性,警示不应过度解读其结果。
  • STOPS数据集源自真实的Amazon和Yelp数据,证明了Transformer在业务相关短文本分类任务中可实现高准确率,具备实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。