[论文解读] Label Confusion Learning to Enhance Text Classification Models
本文提出标签混淆学习(LCM),一种用于文本分类模型的新增强方法,通过基于实例与标签之间语义相似性的学习,将单热标签向量替换为学习得到的标签混淆分布(LCD)。通过建模标签重叠与依赖关系,LCM在混淆或噪声数据集上显著提升性能,优于标签平滑化方法及LSTM、CNN、BERT等增强模型,在五个英文与中文基准数据集上表现更优。
Representing a true label as a one-hot vector is a common practice in training text classification models. However, the one-hot representation may not adequately reflect the relation between the instances and labels, as labels are often not completely independent and instances may relate to multiple labels in practice. The inadequate one-hot representations tend to train the model to be over-confident, which may result in arbitrary prediction and model overfitting, especially for confused datasets (datasets with very similar labels) or noisy datasets (datasets with labeling errors). While training models with label smoothing (LS) can ease this problem in some degree, it still fails to capture the realistic relation among labels. In this paper, we propose a novel Label Confusion Model (LCM) as an enhancement component to current popular text classification models. LCM can learn label confusion to capture semantic overlap among labels by calculating the similarity between instances and labels during training and generate a better label distribution to replace the original one-hot label vector, thus improving the final classification performance. Extensive experiments on five text classification benchmark datasets reveal the effectiveness of LCM for several widely used deep learning classification models. Further experiments also verify that LCM is especially helpful for confused or noisy datasets and superior to the label smoothing method.
研究动机与目标
- 解决单热标签表示在文本分类中的局限性,其假设标签独立,无法捕捉相似标签之间的语义重叠。
- 缓解人类标注数据集中因噪声或模糊标签导致的模型过度自信与过拟合问题。
- 通过学习更真实的标签分布以反映真实标签依赖关系,提升文本分类的泛化能力。
- 开发一种即插即用的组件(LCM),在不修改模型架构或增加推理成本的前提下增强现有深度学习模型。
- 在多样化数据集上(包括高混淆或标注噪声数据)验证LCM的有效性,并将其适用性扩展至图像分类任务。
提出的方法
- 使用共享嵌入层学习标签表示,并计算输入文本表示与标签嵌入之间的语义相似度。
- 通过聚合所有标签的相似度得分,构建标签混淆分布(LCD),以捕捉每个标签与输入实例之间的依赖关系。
- 使用可学习参数α将原始单热标签向量与LCD结合,再通过softmax归一化为模拟标签分布(SLD)。
- 在训练过程中使用SLD作为交叉熵损失的目标,替代标准单热向量,以提供更具信息量的监督信号。
- 仅在训练阶段将LCM作为轻量级可训练组件集成——推理阶段或模型结构无需修改,实现即插即用的增强效果。
- 对LCM采用早停策略,防止过拟合,尤其在训练后期模型可能开始退化时。
实验结果
研究问题
- RQ1通过学习的语义相似性建模标签混淆,是否能超越标准单热标签表示,提升文本分类性能?
- RQ2在标签高度相似(即混淆)的数据集上,LCM相较于标签平滑化和标准训练方法表现如何?
- RQ3LCM是否能有效降低过拟合,并在存在标注错误的噪声数据集上提升鲁棒性?
- RQ4LCM能否推广至文本分类以外的任务,如图像分类?
- RQ5哪些超参数(如α)和训练策略(如早停)能优化LCM在不同数据集上的性能?
主要发现
- LCM在五个基准文本分类数据集(包括IMDB、20NG及中文数据集)上,对LSTM、CNN和BERT模型均显著提升分类准确率。
- 在高度混淆的数据集(如8NG-H和4NG-H)上,LCM实现显著增益——最高达3.5%的准确率提升,而在较简单、混淆度较低的数据集(如4NG-E)上则仅获得微小或负向增益。
- LCM始终优于标签平滑化(LS),尤其在噪声环境下:在20NG数据集(20%噪声)上,LCM较LS提升超过2%的准确率。
- 在图像分类任务中,LCM将MNIST测试准确率从基线CNN的98.22%提升至98.41%,Fashion MNIST从89.29%提升至90.28%,证明其跨领域适用性。
- 对LCM训练采用早停策略可防止过拟合,并进一步提升性能,最优结果出现在LCM训练约10个周期后停用。
- 较小的α值(如0.5)在混淆或噪声数据集上通常表现更优,表明其对标签相似度与错误率具有敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。