[论文解读] An Effective Label Noise Model for DNN Text Classification
该论文提出了一种集成于卷积神经网络(CNN)中的非线性噪声模型层,与网络联合训练以建模并缓解标签噪声。通过适当的初始化和正则化,该模型即使在极端标签噪声下也能学习到鲁棒的句子表征,显著提升了在噪声数据上训练的标准深度神经网络(DNN)的泛化能力。
Because large, human-annotated datasets suffer from labeling errors, it is crucial to be able to train deep neural networks in the presence of label noise. While training image classification models with label noise have received much attention, training text classification models have not. In this paper, we propose an approach to training deep networks that is robust to label noise. This approach introduces a non-linear processing layer (noise model) that models the statistics of the label noise into a convolutional neural network (CNN) architecture. The noise model and the CNN weights are learned jointly from noisy training data, which prevents the model from overfitting to erroneous labels. Through extensive experiments on several text classification datasets, we show that this approach enables the CNN to learn better sentence representations and is robust even to extreme label noise. We find that proper initialization and regularization of this noise model is critical. Further, by contrast to results focusing on large batch sizes for mitigating label noise for image classification, we find that altering the batch size does not have much effect on classification performance.
研究动机与目标
- 解决在由人工标注错误污染的大规模文本数据集上训练深度神经网络的挑战。
- 在存在噪声标签的情况下改进句子表征学习,因为此类噪声通常会降低模型性能。
- 开发一种无需辅助清洁数据的方法,实现直接从噪声标签进行鲁棒训练。
- 研究初始化、正则化和批量大小对文本分类中噪声鲁棒性的影响。
提出的方法
- 在卷积神经网络(CNN)之上引入一个非线性噪声模型层,用于在训练过程中建模标签噪声的统计特性。
- 使用反向传播在噪声训练数据上联合优化噪声模型和CNN权重。
- 噪声模型学习一个转移矩阵,表示标签翻转的概率,从而有效充当标签去噪算子。
- 噪声模型层的适当初始化对于防止对噪声标签的过拟合至关重要。
- 对噪声模型应用正则化技术,以提升泛化能力并防止对错误标签的记忆。
- 通过t-SNE可视化特征表征以及在学习到的嵌入表示上进行SVM微调,评估噪声模型的有效性。
实验结果
研究问题
- RQ1非线性噪声模型层是否能提升在人工注入标签噪声的文本分类任务中深度神经网络的性能?
- RQ2噪声模型的初始化和正则化如何影响其在极端标签噪声下的鲁棒性?
- RQ3在使用噪声标签进行文本分类训练时,改变批量大小是否显著影响模型性能?
- RQ4与标准DNN相比,该噪声模型在多大程度上提升了学习到的句子表征的质量?
- RQ5该噪声模型能否有效去除标签噪声,并帮助基础网络在存在噪声监督的情况下学习到真实的底层模式?
主要发现
- 在SST-2数据集上,当标签噪声达到40%时,所提出的噪声模型达到83.25%的准确率,显著优于基线模型(70.24%)和无噪声模型的模型(70.95%)。
- 在AG-News数据集上,当噪声比例为70%时,该方法达到90.33%的准确率,显著优于基线(59.70%)和无噪声模型的模型(52.44%)。
- 噪声模型的适当初始化和正则化至关重要;若缺乏这些,模型在极端噪声下无法实现泛化。
- 批量大小对性能影响极小,这与图像分类中的发现相反——在图像分类中,大批量大小有助于缓解标签噪声。
- t-SNE可视化显示,噪声模型使真实类别标签在特征空间中形成更优的聚类,而基线模型则学习到噪声大、错误聚类的表征。
- 在所提模型学习到的特征上训练的SVM泛化能力更强:当使用真实标签进行训练时,SVM在SST-2上达到83.25%的准确率,与所提模型性能一致,表明其学习到了有效的特征表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。