Skip to main content
QUICK REVIEW

[论文解读] An Empirical Study on Few-shot Knowledge Probing for Pretrained Language Models

Tianxing He, Kyunghyun Cho|arXiv (Cornell University)|Sep 6, 2021
Topic Modeling参考文献 26被引用 5
一句话总结

本文研究了预训练语言模型中的少样本知识探针,提出仅微调偏置向量(BitFit)显著优于提示工程和上下文学习。利用新构建的两跳关系数据集(TREx-2p),作者表明仅需10–20个少样本示例即可显著提升零样本性能,BitFit通过以极少参数有效正则化模型,实现了最先进结果。

ABSTRACT

Prompt-based knowledge probing for 1-hop relations has been used to measure how much world knowledge is stored in pretrained language models. Existing work uses considerable amounts of data to tune the prompts for better performance. In this work, we compare a variety of approaches under a few-shot knowledge probing setting, where only a small number (e.g., 10 or 20) of example triples are available. In addition, we create a new dataset named TREx-2p, which contains 2-hop relations. We report that few-shot examples can strongly boost the probing performance for both 1-hop and 2-hop relations. In particular, we find that a simple-yet-effective approach of finetuning the bias vectors in the model outperforms existing prompt-engineering methods. Our dataset and code are available at \url{https://github.com/cloudygoose/fewshot_lama}.

研究动机与目标

  • 评估在有限监督下预训练语言模型中的少样本知识探针。
  • 探究在少样本设置下,提示工程与模型微调哪种方法性能更优。
  • 构建一个新的基准数据集TREx-2p,用于两跳关系知识探针评估。
  • 评估上下文学习、连续提示调优(OptiPrompt)和参数高效微调(BitFit)在少样本设置下的有效性。

提出的方法

  • 作者提出TREx-2p,一个包含两跳关系的新数据集,用于评估更复杂的知识探针。
  • 比较多种少样本提示策略:人工模板(manT)、挖掘模板(mineT)、默认模板(defT)、上下文学习、OptiPrompt(连续提示调优)以及模型微调。
  • BitFit通过仅微调最后一层或隐藏层的偏置向量来实现,从而最小化参数量并减少过拟合。
  • 使用平均倒数排名(MRR)评估性能,并在小规模开发集上采用早停策略以防止过拟合。
  • OptiPrompt通过可学习的连续提示标记,在训练过程中动态调整输入提示。
  • 消融研究对比了全模型微调、BitFit以及控制基线(仅输出层或隐藏层偏置微调),以隔离偏置微调的影响。

实验结果

研究问题

  • RQ1少量示例是否能显著提升预训练语言模型中零样本知识探针的准确率?
  • RQ2在少样本知识探针中,微调偏置向量(BitFit)是否优于提示工程和上下文学习?
  • RQ3在少样本设置下,少样本提示在一对关系和两跳关系上的性能表现如何变化,尤其是考虑到两跳模板句法复杂度的增加?
  • RQ4在少样本设置下,连续提示调优(OptiPrompt)是否优于离散的人工或挖掘模板?
  • RQ5人工模板与OptiPrompt或BitFit的结合是否能带来额外性能增益?

主要发现

  • 10–20个少样本示例显著提升了对一跳和两跳关系的探针准确率,性能在约200个示例后趋于饱和。
  • BitFit(仅微调偏置向量)实现了最先进性能,在大多数情况下优于全模型微调和OptiPrompt。
  • OptiPrompt优于人工模板和挖掘模板,证实了连续提示调优相比离散模板的优势。
  • 上下文学习在10–20-shot设置下表现具有竞争力,但性能迅速饱和,在40-shot设置下被OptiPrompt超越。
  • 人工模板在两跳关系上的零样本性能极低(14.4%),表明句法复杂度增加带来了显著挑战。
  • 仅微调输出层或隐藏层偏置的控制基线表现劣于BitFit,证明知识访问的增强不仅源于简单的输出偏置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。