[论文解读] Learning How to Ask: Querying LMs with Mixtures of Soft Prompts
本文提出学习软提示——即使用连续向量序列而非离散词汇来查询预训练语言模型,通过梯度下降优化提示的混合体。该方法在事实知识探测任务中显著优于先前方法,即使在随机初始化的情况下也表现出色,表明语言模型中可访问的知识远超以往认知。
Natural-language prompts have recently been used to coax pretrained language models into performing other AI tasks, using a fill-in-the-blank paradigm (Petroni et al., 2019) or a few-shot extrapolation paradigm (Brown et al., 2020). For example, language models retain factual knowledge from their training corpora that can be extracted by asking them to "fill in the blank" in a sentential prompt. However, where does this prompt come from? We explore the idea of learning prompts by gradient descent -- either fine-tuning prompts taken from previous work, or starting from random initialization. Our prompts consist of "soft words," i.e., continuous vectors that are not necessarily word type embeddings from the language model. Furthermore, for each task, we optimize a mixture of prompts, learning which prompts are most effective and how to ensemble them. Across multiple English LMs and tasks, our approach hugely outperforms previous methods, showing that the implicit factual knowledge in language models was previously underestimated. Moreover, this knowledge is cheap to elicit: random initialization is nearly as good as informed initialization.
研究动机与目标
- 提升提示预训练语言模型在事实知识提取任务中的性能,超越人工设计或挖掘的提示。
- 探究连续可学习的‘软提示’是否能在激发语言模型知识方面优于传统的离散词汇提示。
- 探索软提示的随机初始化是否能与基于先前工作的启发式初始化相媲美或超越其性能。
- 评估软提示混合体的有效性,其中每个提示根据任务和输入自适应地加权。
- 确定微调语言模型的所有层(深层提示)是否能进一步提升性能,超过仅微调第0层的效果。
提出的方法
- 将提示表示为连续向量序列(‘软词’),而非离散标记,从而在连续空间中实现基于梯度的优化。
- 使用梯度下降优化软提示的混合体,其中每个提示是可学习的连续嵌入序列。
- 采用可微分的混合机制组合多个软提示,其混合权重可学习并根据输入自适应调整。
- 在填空式事实知识探测任务上,使用标准语言建模范式端到端训练软提示。
- 将方法扩展至微调所有Transformer层的嵌入表示(深层提示),而不仅限于输入层。
- 应用基于温度的门控机制,使混合权重依赖于数据,实现对每个输入的有效提示动态选择。
实验结果
研究问题
- RQ1通过梯度下降优化的软提示是否能在知识探测任务中显著超越人工设计或挖掘的离散提示?
- RQ2软提示的随机初始化是否能与基于先前提示的初始化表现相当或更优,表明优化过程具有鲁棒性?
- RQ3具有可学习权重的软提示混合体是否能提升在多样化事实关系上的泛化能力与性能,优于单一提示?
- RQ4对所有Transformer层进行微调(深层提示)是否能带来相较于仅微调第0层的额外增益?
- RQ5依赖于数据的混合权重如何影响性能,模型是否学会抑制无关的提示组件?
主要发现
- 所提出的软提示方法在T-REx和Google-RE数据集上达到最先进性能,当在BERT-large上随机初始化时,Google-RE数据集的P@1得分为14.5。
- 即使在随机初始化下,该方法也大幅超越所有先前方法,包括LAMA和LPAQA——例如,在Google-RE数据集上,BERT-large的P@1得分比基线LAMA高出14.5。
- 微调软提示向量(而非仅混合权重)带来了最大的性能提升,使用挖掘初始化时在T-REx数据集上达到12.9的P@1得分。
- 软提示混合体始终优于单一提示,最佳系统采用从挖掘提示初始化并跨所有层微调的软提示混合体。
- 深层提示(微调所有层)带来了微小但稳定的性能提升,尽管在RoBERTa模型上性能有所下降,表明对模型具有特定敏感性。
- 通过温度门控实现的依赖数据的混合权重影响甚微,因为模型学会将温度设得很高,从而有效忽略输入相关的权重。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。