[论文解读] An Effective, Performant Named Entity Recognition System for Noisy Business Telephone Conversation Transcripts
本文提出一种先蒸馏后微调的方法,利用微调后的 LUKE 模型作为教师模型,为较小的 DistilBERT 学生模型生成伪标签以进行知识蒸馏。所得学生模型的 F1 分数达到教师模型的 99.09%(85.29% vs. 86.07%),同时推理速度提升 75 倍(推理时间 40ms),实现在计算资源有限的 CPU 上对嘈杂的业务电话转录文本进行实时部署,且仅需极少的人工标注数据。
We present a simple yet effective method to train a named entity recognition (NER) model that operates on business telephone conversation transcripts that contain noise due to the nature of spoken conversation and artifacts of automatic speech recognition. We first fine-tune LUKE, a state-of-the-art Named Entity Recognition (NER) model, on a limited amount of transcripts, then use it as the teacher model to teach a smaller DistilBERT-based student model using a large amount of weakly labeled data and a small amount of human-annotated data. The model achieves high accuracy while also satisfying the practical constraints for inclusion in a commercial telephony product: realtime performance when deployed on cost-effective CPUs rather than GPUs.
研究动机与目标
- 开发一种在嘈杂、由语音识别生成的业务电话对话转录文本上表现良好的命名实体识别(NER)系统。
- 解决在嘈杂、口语化转录文本上训练 NER 模型时人工标注数据有限的挑战。
- 实现在计算成本低的生产环境中实时推理,特别是基于 CPU 而非 GPU 的部署。
- 通过知识蒸馏结合伪标签数据,减少对大规模人工标注的依赖。
提出的方法
- 在少量人工标注的、嘈杂的业务电话转录文本上微调大型先进模型 LUKE,构建教师模型。
- 使用微调后的 LUKE 模型在大规模未标注的嘈杂电话对话转录文本数据集上生成伪标签。
- 使用交叉熵损失函数,在伪标签蒸馏数据上训练一个更小的基于 DistilBERT 的学生模型。
- 使用少量人工标注的领域内数据对学⽣模型进行第二阶段微调,以提升性能。
- 优化学生模型的推理速度与效率,目标是在 CPU 上实现低于 200ms 的延迟。
- 使用交叉熵损失函数:$ L_{CE} = -\frac{1}{N}\sum_{n=1}^{N}\log\frac{e^{\hat{y}_{n,y_{n}}}}{\sum_{c=1}^{C}e^{\hat{y}_{n,c}}} $,其中 $ \hat{y}_{n,c} $ 表示样本 $ n $ 中类别 $ c $ 的 logits。
实验结果
研究问题
- RQ1知识蒸馏能否有效将大型、高精度 NER 模型的性能迁移到小型、快速模型上,应用于嘈杂的真实世界电话转录文本?
- RQ2在低资源、嘈杂的 NLP 场景中,教师模型生成的伪标签在多大程度上能减少对昂贵人工标注的依赖?
- RQ3蒸馏后的学生模型能否在满足 CPU 上严格实时推理要求的同时,实现接近教师模型的性能?
- RQ4与仅在有限人工标注数据上进行单阶段微调相比,两阶段微调(蒸馏 + 领域内微调)的性能表现如何?
主要发现
- DistilBERT dtft 模型的 F1 分数达到 85.29%,为 LUKE ft 模型 F1 分数 86.07% 的 99.09%。
- 与 LUKE ft 模型相比,DistilBERT dtft 模型在推理时间上实现了 75 倍的加速(40ms vs. 2980ms),支持在 CPU 上实现实时部署。
- 尽管架构与推理时间与 DistilBERT ft 模型相同,该蒸馏模型仍以近 2.2 个百分点的优势超越了后者(83.08% F1)。
- 该方法通过利用教师模型生成的大规模伪标签数据,显著减少了对人工标注数据的需求。
- 两阶段微调流程——先在蒸馏数据上微调,再在领域内数据上微调——被证明对在极少人工标注下实现高性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。