[论文解读] Are Pretrained Transformers Robust in Intent Classification? A Missing Ingredient in Evaluation of Out-of-Scope Intent Detection
本文研究了预训练Transformer模型在少样本意图分类中的鲁棒性,发现尽管在域内和域外的OOS样本上表现良好,但其在语义相似但不支持的域内OOS(ID-OOS)样本上表现较差。作者构建了两个新数据集(CLINC-Single-Domain-OOS 和 BANKING77-OOS),并表明包括 BERT、RoBERTa 和 ToD-BERT 在内的模型即使在屏蔽重叠关键词后,仍会以高置信度将 ID-OOS 样本错误分类为域内意图,表明评估和模型鲁棒性方面存在关键缺陷。
Pre-trained Transformer-based models were reported to be robust in intent classification. In this work, we first point out the importance of in-domain out-of-scope detection in few-shot intent recognition tasks and then illustrate the vulnerability of pre-trained Transformer-based models against samples that are in-domain but out-of-scope (ID-OOS). We construct two new datasets, and empirically show that pre-trained models do not perform well on both ID-OOS examples and general out-of-scope examples, especially on fine-grained few-shot intent detection tasks. To figure out how the models mistakenly classify ID-OOS intents as in-scope intents, we further conduct analysis on confidence scores and the overlapping keywords, as well as point out several prospective directions for future work. Resources are available on https://github.com/jianguoz/Few-Shot-Intent-Detection.
研究动机与目标
- 研究预训练Transformer模型在少样本意图分类中的鲁棒性,特别是针对语义上相似但不支持的域内OOS(ID-OOS)样本。
- 解决对语义相似但属于域内且不支持的OOS样本缺乏评估的问题,这类样本在真实对话系统中很常见。
- 构建并发布两个新数据集——CLINC-Single-Domain-OOS 和 BANKING77-OOS——专门用于细粒度少样本场景下的ID-OOS和一般OOS意图检测。
- 分析模型为何在高置信度分数下仍无法检测ID-OOS样本,重点关注关键词重叠和置信度分布。
- 识别当前评估协议中的关键缺陷,并为未来鲁棒OOS检测研究提供方向。
提出的方法
- 通过从域内类别中提取语义相关但不支持的意图,构建了两个新数据集:CLINC-Single-Domain-OOS 和 BANKING77-OOS,形成ID-OOS样本。
- 使用在开发集上调优的阈值,基于置信度的OOS检测方法评估五种预训练模型——BERT、RoBERTa、ALBERT、ELECTRA 和 ToD-BERT。
- 通过将ID-OOS样本中前5个重叠的单字词替换为 [MASK] 标记,应用掩码语言建模方法,评估关键词重叠对误分类的影响。
- 报告标准指标:域内准确率(A_in)、OOS召回率(R_oos)和OOS精确率(P_oos),通过阈值优化使A_in与R_oos的调和平均数最大化。
- 对置信度分数分布和混淆矩阵进行消融分析,以识别误分类中的模式。
- 在少样本(5-shot)和全样本设置之间进行对比,评估训练数据规模对ID-OOS检测的影响。
实验结果
研究问题
- RQ1当面对语义上与域内意图相似但不支持的域内OOS(ID-OOS)样本时,预训练Transformer模型是否具有鲁棒性?
- RQ2预训练模型在ID-OOS检测上的表现与在域外OOS(OOD-OOS)和域内样本上的表现相比如何?
- RQ3即使在屏蔽后,ID-OOS与域内意图之间的关键词重叠在多大程度上仍会导致模型误分类?
- RQ4为何模型会为ID-OOS样本分配高置信度分数,尽管其分类结果是错误的?
- RQ5现有的基于对比学习的少样本学习方法能否显著提升ID-OOS样本上的OOS检测性能?
主要发现
- 与OOD-OOS样本相比,预训练模型在ID-OOS样本上的域内准确率显著降低,且随着模型复杂度的增加,性能差距进一步扩大。
- ID-OOS检测的OOS召回率和精确率远低于OOD-OOS检测,表明模型在语义相似但不支持的意图上泛化能力差。
- 即使在屏蔽ID-OOS与域内意图对之间前5个重叠单字词后,模型仍会为错误的域内类别分配高置信度分数(例如0.84和0.86),表明其依赖于关键词之外的上下文线索。
- RoBERTa在整体上表现优于其他模型,但仍无法将ID-OOS样本与域内样本区分开来,尤其是在BANKING77等细粒度、高多样性领域中。
- ToD-BERT(在任务导向对话数据上预训练)在ID-OOS检测中表现欠佳,表明领域特定的预训练并不能保证对OOS意图检测的鲁棒性。
- 对比学习方法并未显著提升OOS检测性能,表明当前的少样本学习技术不足以应对ID-OOS挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。