Skip to main content
QUICK REVIEW

[论文解读] Enriched Pre-trained Transformers for Joint Slot Filling and Intent Detection

Momchil Hardalov, Ivan Koychev|arXiv (Cornell University)|Apr 30, 2020
Topic Modeling被引用 11
一句话总结

该论文提出 Transformer-NLU,一种联合意图检测与槽位填充模型,通过在 BERT 和 RoBERTa 基础上引入意图池化注意力机制、词级特征(大小写、命名实体识别 NER)以及意图引导的槽位表示,显著提升了性能。在 SNIPS 上,槽位 F1 和意图准确率的错误率降低超过 55%;在 ATIS 上,错误率降低约 5%。

ABSTRACT

Detecting the user's intent and finding the corresponding slots among the utterance's words are important tasks in natural language understanding. Their interconnected nature makes their joint modeling a standard part of training such models. Moreover, data scarceness and specialized vocabularies pose additional challenges. Recently, the advances in pre-trained language models, namely contextualized models such as ELMo and BERT have revolutionized the field by tapping the potential of training very large models with just a few steps of fine-tuning on a task-specific dataset. Here, we leverage such models, namely BERT and RoBERTa, and we design a novel architecture on top of them. Moreover, we propose an intent pooling attention mechanism, and we reinforce the slot filling task by fusing intent distributions, word features, and token representations. The experimental results on standard datasets show that our model outperforms both the current non-BERT state of the art as well as some stronger BERT-based baselines.

研究动机与目标

  • 解决低资源 NLU 任务中标签数据有限和专业词汇表带来的挑战。
  • 通过超越标准微调的方式,利用预训练语言模型提升联合意图分类与槽位填充性能。
  • 通过显式特征(大小写、NER)和预测的意图分布作为引导,增强槽位填充能力。
  • 探究预训练模型中隐含的知识表征对 NLU 任务的影响。
  • 设计一种优于 [CLS] 标记的更有效的池化机制,用于意图表示。

提出的方法

  • 引入一种意图池化注意力层,计算来自 BERT/RoBERTa 最后一层的所有标记表示的加权和,取代对 [CLS] 标记的依赖。
  • 为每个标记提取词级特征,包括真实大小写和命名实体识别(NER)预测结果。
  • 将预测的意图分布、BERT/RoBERTa 的最后一层隐藏状态以及词级特征融合到统一的槽位填充层中。
  • 在槽位预测头之上使用 CRF 层,以建模标签之间的依赖关系。
  • 在 ATIS 和 SNIPS 数据集上端到端训练模型,采用联合损失函数同时优化意图分类与槽位标注。
  • 通过消融研究评估各组件的独立贡献。
(a) BERT-Joint.
(a) BERT-Joint.

实验结果

研究问题

  • RQ1相比 [CLS] 标记,更有效的意图表示是否能提升联合意图识别与槽位填充的性能?
  • RQ2引入与词相关的特征(大小写、NER)对槽位填充准确率的提升程度如何?
  • RQ3将预测的意图分布作为引导,对槽位标注性能的增强作用有多大?
  • RQ4增强后的模型是否在标准 NLU 基准上超越非 BERT 模型和强基线 BERT 模型?
  • RQ5预训练模型(如 BERT 和 RoBERTa)中编码了哪些与任务相关的隐含知识,适用于 NLU 任务?

主要发现

  • Transformer-NLU 在 ATIS 上实现了 97.87% 的意图准确率,在 SNIPS 上达到 98.86%,显著优于之前的非 BERT SOTA 模型。
  • 在 SNIPS 数据集上,与之前最先进方法相比,该模型在槽位 F1 上的错误率降低了超过 55%,达到 96.57% 的 F1 分数。
  • 在 ATIS 上,该模型在槽位 F1 上实现了 13.66% 的相对错误率降低,F1 达到 96.25%。
  • 使用 RoBERTa 和 CRF 层并未进一步提升性能,表明所提出的改进措施比架构变更更具影响力。
  • 意图池化机制与特征融合对性能提升贡献显著,尤其在低资源设置下表现突出。
  • 该模型表明,预训练模型中蕴含了大量与意图和槽位检测相关的隐含知识,可通过架构改进被有效利用。
(b) Transformer-NLU (ours).
(b) Transformer-NLU (ours).

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。