[论文解读] Semi-Supervised Few-Shot Intent Classification and Slot Filling
该论文提出了一种半监督少样本学习框架,用于意图分类(IC)和槽位填充(SF),通过将对比学习与数据增强整合到原型网络元学习流程中。结果表明,将对比损失与数据增强——尤其是新颖的基于槽位列表的方法——相结合,能显著提升少样本IC性能,在SNIPS和ATIS基准上超越了当前最先进模型。
Intent classification (IC) and slot filling (SF) are two fundamental tasks in modern Natural Language Understanding (NLU) systems. Collecting and annotating large amounts of data to train deep learning models for such systems is not scalable. This problem can be addressed by learning from few examples using fast supervised meta-learning techniques such as prototypical networks. In this work, we systematically investigate how contrastive learning and unsupervised data augmentation methods can benefit these existing supervised meta-learning pipelines for jointly modelled IC/SF tasks. Through extensive experiments across standard IC/SF benchmarks (SNIPS and ATIS), we show that our proposed semi-supervised approaches outperform standard supervised meta-learning methods: contrastive losses in conjunction with prototypical networks consistently outperform the existing state-of-the-art for both IC and SF tasks, while data augmentation strategies primarily improve few-shot IC by a significant margin.
研究动机与目标
- 通过在有限标注数据下提升少样本意图分类(IC)和槽位填充(SF)性能,应对低资源NLU挑战。
- 探究无监督对比学习与数据增强如何在少样本IC/SF的元学习中起到正则化与增强作用。
- 开发并评估专为IC/SF任务设计的新颖数据增强策略,如基于槽位列表的值生成。
- 系统比较数据增强与对比学习在元学习流程不同阶段(支持集与查询集,元训练与元测试)的影响。
- 建立一个强大的半监督少样本IC/SF基准,有效结合多种正则化技术。
提出的方法
- 采用基于原型网络的元学习框架,使用在元训练过程中微调的RoBERTa编码器,替代先前工作中使用的固定主干网络。
- 在元训练期间,通过在支持集和查询集上最小化对比损失,将对比学习作为正则化器,提升原型的泛化能力。
- 提出一种新颖的数据增强策略——槽位列表值生成,通过用基于词典的替代值替换槽位值来生成合成话语。
- 应用已有的NLP增强技术,如回译(backtranslation)和EDA(Easy Data Augmentation),生成扰动的训练样本。
- 通过联合损失函数联合优化原型损失与对比损失,用于IC和SF分支,实现端到端训练。
- 采用动态episode采样策略,跨5个随机种子对意图类别进行随机划分,以确保评估稳健性并避免人工类别选择带来的偏差。
实验结果
研究问题
- RQ1对比学习能否在少样本IC/SF元学习中作为有效正则化器,提升对未见类别的泛化能力?
- RQ2不同数据增强策略——尤其是基于槽位列表的值、回译和EDA——如何影响少样本IC与SF性能?
- RQ3数据增强的时机与位置(元训练期间 vs. 元测试期间)是否显著影响模型性能?
- RQ4将对比学习与数据增强结合是否能取得优于单独使用任一技术的性能?
- RQ5为何数据增强技术在IC上增益更强而对SF影响较小?句法信息在缓解这一差距中起到何种作用?
主要发现
- 在元训练期间同时使用支持集和查询集特征进行对比学习,可在SNIPS(Kmax=20)上将少样本IC准确率提升最多2.5个百分点,在ATIS(Kmax=20)上提升2.1个百分点,优于基线和先前SOTA模型。
- 对比学习与基于槽位列表的数据增强相结合,在所有设置中均取得最高IC准确率(SNIPS上为92.1%,Kmax=20)和SF F1(74.8%)。
- 在元训练和元测试期间均应用EDA增强,可在SNIPS上使IC准确率最高提升4个百分点,尤其在Kmax=20时效果显著。
- 回译在SNIPS上使Kmax=100时的IC性能得到提升,但在ATIS上增益有限,表明其效果具有领域特异性。
- 数据增强对SF F1得分影响极小,表明槽位级别的扰动无法为低样本槽位分类提供足够信号。
- 在模型中引入句法信息仅带来微小提升,可能是因为在episode采样中每个槽位类别的样本数量过低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。