Skip to main content
QUICK REVIEW

[论文解读] Joint model for intent and entity recognition

Petr Lorenc|arXiv (Cornell University)|Sep 7, 2021
Topic Modeling参考文献 7被引用 4
一句话总结

本文提出了一种联合深度学习模型,用于意图分类和命名实体识别(NER),采用词嵌入(GloVe、FastText、BERT)和基于字符级表示的卷积神经网络。该模型在使用GloVe嵌入时,NER的F1分数达到98.44,意图分类的F1分数达到95.74,优于单任务基线模型,同时通过联合学习减少了模型复杂度和训练时间。

ABSTRACT

The semantic understanding of natural dialogues composes of several parts. Some of them, like intent classification and entity detection, have a crucial role in deciding the next steps in handling user input. Handling each task as an individual problem can be wasting of training resources, and also each problem can benefit from each other. This paper tackles these problems as one. Our new model, which combine intent and entity recognition into one system, is achieving better metrics in both tasks with lower training requirements than solving each task separately. We also optimize the model based on the inputs.

研究动机与目标

  • 开发一种能够同时执行意图分类和命名实体识别的联合模型,以提升效率和性能。
  • 评估不同词嵌入(GloVe、FastText、BERT)对联合意图与实体识别任务的影响。
  • 在ATIS数据集上,比较两种模型架构——一种使用双向LSTM,另一种使用时延分布式神经网络——的性能。
  • 证明联合建模可在保持或提升性能的同时,减少模型复杂度和训练时间,优于独立模型。
  • 探究BERT嵌入是否能从额外的上下文感知网络(如LSTM)中获益,或因其固有的上下文表征而造成冗余。

提出的方法

  • 该模型使用通过一维卷积神经网络(CNN)处理的字符级嵌入,以捕捉子词特征。
  • 为每个标记引入词级特征,如大小写类型、数值状态和大写情况。
  • 该模型在词嵌入架构上具有通用性,可无缝集成GloVe、FastText或BERT嵌入,无需代码修改。
  • 实现两种模型变体:一种使用双向LSTM进行序列建模,另一种使用时延分布式前馈网络。
  • 应用Dropout和早停策略以防止过拟合,若验证损失在两个周期内未改善则停止训练。
  • 该模型在公开的ATIS数据集上进行训练和评估,其中意图分类任务包含4,978个训练样本和893个测试样本,NER任务包含20,426个训练样本和3,665个测试样本。

实验结果

研究问题

  • RQ1联合模型在意图分类和NER任务上的准确率与F1分数是否优于独立模型?
  • RQ2不同词嵌入(GloVe、FastText、BERT)对联合模型在意图与实体识别任务上的性能有何影响?
  • RQ3在使用BERT嵌入时,额外引入上下文感知网络(如LSTM)是否能提升性能,还是可能引入噪声?
  • RQ4联合模型是否能以更少的参数和更快的训练速度,实现与单任务模型相当或更优的性能?
  • RQ5架构选择(LSTM与时延分布式网络)对模型效率和性能有何影响?

主要发现

  • 使用GloVe嵌入的联合模型在NER任务上取得了最高的F1分数98.44,优于BERT(95.78)和FastText(96.83)。
  • 同一模型在意图分类任务上达到了95.74%的准确率,优于BERT(92.45%)和FastText(90.70%)。
  • 当使用BERT嵌入时,采用时延分布式网络的模型(模型2)优于基于LSTM的版本,表明LSTM未带来增益,反而可能引入噪声。
  • 模型2的训练时间相比模型1减少了65%(每轮8秒 vs. 每轮23秒),性能仅出现轻微下降。
  • 联合模型在NER任务上实现了SOTA性能(F1分数98.44),并在意图分类任务上取得了高准确率(95.74%),优于比较中的先前单任务模型。
  • 模型2的参数量显著减少至724,882,远低于模型1的2.5M,证明了更高的效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。