[论文解读] Less is More: Parameter-Free Text Classification with Gzip
本文提出了一种无需参数调整的文本分类方法,结合gzip压缩与k近邻分类器,在分布内数据集上实现了具有竞争力的准确率,并且在分布外和少样本设置下无需任何训练或超参数调优即优于BERT。
Deep neural networks (DNNs) are often used for text classification tasks as they usually achieve high levels of accuracy. However, DNNs can be computationally intensive with billions of parameters and large amounts of labeled data, which can make them expensive to use, to optimize and to transfer to out-of-distribution (OOD) cases in practice. In this paper, we propose a non-parametric alternative to DNNs that's easy, light-weight and universal in text classification: a combination of a simple compressor like gzip with a $k$-nearest-neighbor classifier. Without any training, pre-training or fine-tuning, our method achieves results that are competitive with non-pretrained deep learning methods on six in-distributed datasets. It even outperforms BERT on all five OOD datasets, including four low-resource languages. Our method also performs particularly well in few-shot settings where labeled data are too scarce for DNNs to achieve a satisfying accuracy.
研究动机与目标
- 开发一种轻量级、通用且无参数的深度神经网络替代方案,用于文本分类。
- 解决深度学习模型在低资源和分布外设置下标签数据稀缺时的局限性。
- 探索无损压缩是否可作为有效的、与数据无关的文本分类距离度量。
- 在包括低资源和多语言设置在内的多样化数据集上评估该方法的性能。
- 证明文本的可压缩性与分类性能相关,尤其是在少样本场景下。
提出的方法
- 该方法使用gzip作为无损压缩器,基于柯尔莫哥洛夫复杂度推导出一种基于压缩的度量距离。
- 对于每个测试样本,计算其与训练样本拼接后的压缩长度,并将该长度与仅压缩训练样本的长度之差用作相似性度量。
- k近邻分类器选择压缩差异最小的k个训练样本,以预测测试样本的类别。
- 该方法避免了任何模型训练、微调或超参数优化,完全依赖压缩器捕捉文本中的规律性。
- 该方法在多个数据集和压缩器(gzip、zstd、bz2、lzma)上应用,性能在完整和少样本设置下均进行了评估。
- 基于压缩的距离度量与传统的交叉熵方法 $C(d_c d_u) - C(d_c)$ 进行了比较,后者将每类的所有训练样本拼接。
实验结果
研究问题
- RQ1基于gzip压缩的非参数、无参数方法是否能在无需任何训练或微调的情况下实现具有竞争力的文本分类准确率?
- RQ2该方法在分布内数据集上与非预训练深度学习模型相比表现如何?
- RQ3该方法是否在分布外和低资源数据集上优于预训练模型如BERT?
- RQ4该方法在标签数据极少的少样本学习场景中效果如何?
- RQ5文本可压缩性与分类准确率之间的关系是什么?不同压缩器对性能有何影响?
主要发现
- 所提方法在六个分布内数据集上实现了具有竞争力的准确率,无需任何训练即可匹配或超过非预训练深度学习模型。
- 在五个分布外数据集上,包括四种低资源语言,该方法优于BERT,展现出强大的泛化能力。
- 在少样本设置下,该方法显著优于非预训练深度学习模型,此时标签数据极为有限。
- gzip在所有数据集中表现出最稳定且优异的性能,而lzma表现具有竞争力但速度较慢;尽管bz2压缩率高,但性能较差,可能由于其对顺序敏感。
- 在少样本设置下,压缩率与测试准确率之间存在中等到强的线性相关性(皮尔逊 $r_p = 0.719$),表明可压缩性可预测分类成功。
- 使用压缩差异的k-NN方法在较长文本(如SogouNews)上优于传统交叉熵方法 ($C(d_c d_u) - C(d_c)$),后者未能有效利用大规模训练集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。