[论文解读] Prototypical Verbalizer for Prompt-based Few-shot Tuning
本文提出原型表述器(ProtoVerb),一种基于对比学习的新型自动表述器构建方法,通过在少样本微调中从训练数据学习类别原型,显著优于现有自动表述器,尤其在低数据设置下表现突出,且即使在未微调的预训练语言模型上也能提升性能,通过捕捉丰富、抽象的类别级语义信息,无需人工设计的标签词。
Prompt-based tuning for pre-trained language models (PLMs) has shown its effectiveness in few-shot learning. Typically, prompt-based tuning wraps the input text into a cloze question. To make predictions, the model maps the output words to labels via a verbalizer, which is either manually designed or automatically built. However, manual verbalizers heavily depend on domain-specific prior knowledge and human efforts, while finding appropriate label words automatically still remains challenging.In this work, we propose the prototypical verbalizer (ProtoVerb) which is built directly from training data. Specifically, ProtoVerb learns prototype vectors as verbalizers by contrastive learning. In this way, the prototypes summarize training instances and are able to enclose rich class-level semantics. We conduct experiments on both topic classification and entity typing tasks, and the results demonstrate that ProtoVerb significantly outperforms current automatic verbalizers, especially when training data is extremely scarce. More surprisingly, ProtoVerb consistently boosts prompt-based tuning even on untuned PLMs, indicating an elegant non-tuning way to utilize PLMs. Our codes are avaliable at https://github.com/thunlp/OpenPrompt.
研究动机与目标
- 为解决人工表述器的局限性,后者需要领域特定知识和人工投入,尤其在低资源设置下。
- 通过从训练样本中学习具有代表性的类别级语义,克服自动表述器构建的挑战,如在低数据设置下性能不佳的问题。
- 开发一种即插即用的非微调方法,提升提示微调性能,而无需对预训练语言模型进行微调。
- 探究从少量样本中学习的原型是否能捕捉抽象、类人的类别概念,并在未见数据上良好泛化。
提出的方法
- ProtoVerb通过在实例与原型之间应用对比学习和InfoNCE损失,学习每个类别的连续原型向量,以对齐实例并使原型趋向类别中心。
- 该方法包含两个损失组件:实例-实例对比损失,用于聚类类内实例并分离类间实例;实例-原型损失,用于强制原型作为中心表示。
- 通过预训练语言模型的隐藏表示端到端优化原型,使其能够从有限的训练数据中总结出丰富的类别级语义。
- 学习到的原型通过与原型向量的余弦相似度,将模型预测(如[MASK]标记)映射到类别标签,从而充当表述器。
- 为解释原型,该方法通过嵌入空间对齐从词汇表中检索最相似的词,实现对原型语义的分析。
- 该方法设计为即插即用,兼容人工表述器和未微调的预训练模型,具备广泛适用性。
实验结果
研究问题
- RQ1从少量训练实例中学习的原型是否能有效表示少样本学习中的类别级语义?
- RQ2在低数据条件下,ProtoVerb与人工、搜索式和软表述器相比,在性能和鲁棒性方面表现如何?
- RQ3ProtoVerb在多大程度上能泛化到未见数据,并捕捉抽象概念而非仅实体名称?
- RQ4即使在未微调的预训练语言模型上使用,ProtoVerb是否仍能提升性能?
- RQ5在语义对齐方面,学习到的原型与人工设计的表述器有多相似?
主要发现
- ProtoVerb在主题分类和实体类型分类任务上显著优于当前最先进自动表述器,尤其在训练数据稀缺时表现更优。
- 在AG's News数据集上,仅使用1个样本时,ProtoVerb达到78.4%的准确率,比次佳基线高出超过5个百分点。
- 与人工表述器结合使用时,ProtoVerb以极低的额外成本持续提升性能,证明其作为互补增强的有效性。
- ProtoVerb对标签噪声具有鲁棒性:即使存在1–3个误标样本,性能下降也显著低于基线方法。
- 仅用一个训练样本,ProtoVerb即可生成有意义的原型——例如,为“Sports”类别识别出“Dodgers”或“Knicks”,证明其能提取关键语义线索。
- 随着样本数增加,原型与人工表述器的相似度提升,平均标准化相似度超过0.25,尤其在“Sports”和“Business”类别中最高,表明其有效抽象了概念性特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。