[论文解读] Learning From How Humans Correct
本文提出了一种新颖的学习框架,将人类校正反馈注入基于 BERT 的文本分类模型,以提升准确率。通过识别模型预测中的噪声标签,手动重新标注这些标签,并使用真实标签和模型先前预测作为输入训练新模型,该方法将测试准确率从原始噪声数据的 83.3% 提升至 91.7% 的重标注数据,最终达到 92.5% 的准确率,证明了从人类校正中学习可显著增强模型的鲁棒性。
In industry NLP application, our manually labeled data has a certain number of noisy data. We present a simple method to find the noisy data and relabel them manually, meanwhile we collect the correction information. Then we present novel method to incorporate the human correction information into deep learning model. Human know how to correct noisy data. So the correction information can be inject into deep learning model. We do the experiment on our own text classification dataset, which is manually labeled, because we need to relabel the noisy data in our dataset for our industry application. The experiment result shows that our learn-on-correction method improve the classification accuracy from 91.7% to 92.5% in test dataset. The 91.7% accuracy is trained on the corrected dataset, which improve the baseline from 83.3% to 91.7% in test dataset. The accuracy under human evaluation achieves more than 97%.
研究动机与目标
- 为解决工业标注的 NLP 数据集中存在的噪声标签问题,此类标签会降低模型性能。
- 开发一种实用方法,利用模型预测作为信号,识别并重新标注噪声数据。
- 通过在原始标签和预测标签上联合训练,将人类校正行为融入深度学习模型。
- 通过建模人类如何纠正错误,而非仅在事后修正标签,来提升文本分类准确率。
- 构建一个可泛化的框架,适用于其他具有人工标注数据的深度学习应用。
提出的方法
- 该方法首先在包含 204 万个样本的标注数据集上训练一个 BERT 模型(Model-A),其中 200 万个用于训练,4 万个用于测试。
- 通过识别 Model-A 的预测与原始人工标签不一致的样本,确定噪声数据,共识别出 30 万个此类样本(训练集中 29.4 万个,测试集中 5.9 万个)。
- 对这 30 万个样本进行人工重新标注,生成经过人工验证的校正数据集。
- 使用校正后的标签以及 Model-A 的独热编码预测结果作为附加输入特征,训练一个新的模型(Model-C)。
- Model-C 的输入表示包括原始文本、校正后的标签以及 Model-A 的先前预测,使模型能够学习校正模式。
- 该框架专为实际部署设计,在推理阶段不依赖预校正标签,仅使用 Model-A 的预测作为输入。
实验结果
研究问题
- RQ1将人类校正反馈注入深度学习模型是否能提升文本分类准确率?
- RQ2与在重标注数据上进行的标准微调相比,从人类校正中学习的效果如何?
- RQ3模型能否通过在原始标签和预测标签上联合训练,学会纠正自身的错误?
- RQ4将模型预测标签作为辅助输入是否能增强模型在噪声数据集上的泛化能力?
- RQ5该方法是否可推广至其他具有人工标注数据的深度学习应用?
主要发现
- 所提出的方法将测试准确率从原始噪声数据的 83.3%(基线)提升至重标注并微调后的 91.7%,证明了校正的价值。
- 在相同测试集上,进一步使用校正感知框架(Model-C)训练后,准确率提升至 92.5%,表明学习校正过程可带来持续的性能增益。
- 对完整 5 亿样本数据集中的 5,000 个样本进行人工评估,准确率达到 97.7%,表明标注质量高且模型性能优异。
- 该方法有效学习了人类校正行为,因为 Model-C 能够基于先前模型的错误调整其预测。
- 该方法在工业应用中具有实用性,因为它在推理阶段避免了对预校正标签的依赖,仅使用模型预测作为输入。
- 该框架可推广至其他具有人工标注数据的深度学习任务,尤其适用于标签噪声问题突出的场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。