[论文解读] $k$-Nearest Neighbor Augmented Neural Networks for Text Classification
本文通过将输入文本的k近邻(kNN)实例级信息作为外部记忆,提出了一种kNN增强的神经网络用于文本分类。该模型将神经网络嵌入与注意力加权的kNN特征相结合——在数据稀缺和类别不平衡情况下显著提升准确率,且在多个基准测试中超越了29层深层网络。
In recent years, many deep-learning based models are proposed for text classification. This kind of models well fits the training set from the statistical point of view. However, it lacks the capacity of utilizing instance-level information from individual instances in the training set. In this work, we propose to enhance neural network models by allowing them to leverage information from $k$-nearest neighbor (kNN) of the input text. Our model employs a neural network that encodes texts into text embeddings. Moreover, we also utilize $k$-nearest neighbor of the input text as an external memory, and utilize it to capture instance-level information from the training set. The final prediction is made based on features from both the neural network encoder and the kNN memory. Experimental results on several standard benchmark datasets show that our model outperforms the baseline model on all the datasets, and it even beats a very deep neural network model (with 29 layers) in several datasets. Our model also shows superior performance when training instances are scarce, and when the training set is severely unbalanced. Our model also leverages techniques such as semi-supervised training and transfer learning quite well.
研究动机与目标
- 解决标准神经网络在捕捉单个训练样本的实例级信息方面存在的局限,尽管其具有强大的统计泛化能力。
- 克服深度神经网络在面对虚假词级信号(例如,'IBM'在训练数据中与'Sci/Tech'强相关)导致误分类时的失败。
- 将非参数化的基于kNN的实例级知识与参数化的神经网络学习相结合,以提升预测的鲁棒性。
- 在低数据量、类别不平衡以及迁移/半监督学习场景中展示方法的有效性。
提出的方法
- 使用神经网络编码器将输入文本及其来自训练集的k近邻(kNN)映射到共享嵌入空间。
- 将每个输入的kNN视为外部记忆,并应用多视角注意力机制,根据与输入的相关性对每个邻居进行加权。
- 基于kNN邻居的注意力权重,计算注意力加权的kNN标签分布和注意力加权的kNN文本嵌入。
- 将三种特征组合用于最终预测:输入文本嵌入、注意力加权的kNN标签分布和注意力加权的kNN文本嵌入。
- 通过使用来自不同数据集(如DBPedia)的kNN作为外部记忆,实现半监督和迁移学习,用于目标任务(如AG’s News)。
- 端到端训练,采用交叉熵损失,使模型能够联合学习编码器和注意力权重。
实验结果
研究问题
- RQ1将基于kNN的实例级信息整合到神经网络模型中,是否能提升文本分类性能,特别是在标准模型因虚假词关联而失效的情况下?
- RQ2在标准、低数据量和类别不平衡训练条件下,所提出的kNN增强模型相较于强基线模型和深层网络(如29层网络)表现如何?
- RQ3在使用来自不同数据集的外部kNN记忆的半监督和迁移学习设置中,kNN增强模型能获得多大程度的收益?
- RQ4对kNN邻居的注意力机制是否能有效检索出相关训练样本,从而纠正由统计偏差导致的模型错误?
主要发现
- 所提出的模型在所有测试的标准基准数据集(包括AG’s News、DBPedia和20 Newsgroups)上均优于BiLSTM基线模型。
- 在多个数据集上,kNN增强模型的表现超越了非常深的29层神经网络,证明了实例级记忆的价值远超单纯增加网络深度。
- 在数据稀缺条件下,该模型表现出优越性能,即使训练样本有限,也能保持高准确率。
- 在类别不平衡的数据集中,该模型实现了显著提升,有效纠正了由主导类别偏差导致的误分类。
- 在半监督学习中,使用DBPedia数据集的kNN作为外部记忆,性能优于BiLSTM基线模型。
- 在迁移学习中,即使DBPedia任务的标签定义与AG’s News不同,利用其kNN记忆仍能提升AG’s News上的性能,表明模型具备强鲁棒性和泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。