Skip to main content
QUICK REVIEW

[论文解读] Few-shot Instruction Prompts for Pretrained Language Models to Detect Social Biases

Shrimai Prabhumoye, Rafał Kocielnik|arXiv (Cornell University)|Dec 15, 2021
Topic Modeling被引用 11
一句话总结

本文提出了一种少样本指令提示方法,用于在无需微调的情况下,利用大规模预训练语言模型(PLMs)检测文本中的少样本偏见。通过从一个小型标注数据仓库中选择类别平衡且语义相似的样本,并使用结构化指令提示PLM,该方法在多个偏见检测任务上实现了最先进或具有竞争力的性能,其中530B参数模型在AUC指标上至少提升了13%,即使仅使用100个标注样本也表现出稳健性。

ABSTRACT

Detecting social bias in text is challenging due to nuance, subjectivity, and difficulty in obtaining good quality labeled datasets at scale, especially given the evolving nature of social biases and society. To address these challenges, we propose a few-shot instruction-based method for prompting pre-trained language models (LMs). We select a few class-balanced exemplars from a small support repository that are closest to the query to be labeled in the embedding space. We then provide the LM with instruction that consists of this subset of labeled exemplars, the query text to be classified, a definition of bias, and prompt it to make a decision. We demonstrate that large LMs used in a few-shot context can detect different types of fine-grained biases with similar and sometimes superior accuracy to fine-tuned models. We observe that the largest 530B parameter model is significantly more effective in detecting social bias compared to smaller models (achieving at least 13% improvement in AUC metric compared to other models). It also maintains a high AUC (dropping less than 2%) when the labeled repository is reduced to as few as $100$ samples. Large pretrained language models thus make it easier and quicker to build new bias detectors.

研究动机与目标

  • 解决在无需大规模、昂贵或嘈杂标注数据集的情况下检测文本中细微、主观社会偏见的挑战。
  • 克服微调大规模PLM的局限性,包括高计算成本、灾难性遗忘以及在小数据集上的过拟合问题。
  • 开发一种灵活的少样本提示框架,利用大规模PLM的内部知识,实现对多种偏见类型的零样本和少样本偏见检测。
  • 通过选择类别平衡且语义相似的样本,而非随机或均匀采样,提升鲁棒性和性能。
  • 证明当使用最小标注数据进行有效提示时,大规模PLM可在偏见检测中超越微调模型。

提出的方法

  • 该方法使用句子编码器将查询文本和小型支持数据仓库中的标注样本嵌入到共享语义空间中。
  • 通过查询嵌入与数据仓库嵌入之间的余弦相似度,为每个类别选择固定数量的样本,确保类别平衡。
  • 将选定的样本与偏见的定义以及查询文本组合成一个自然语言指令提示,格式化为填空模板。
  • 将提示输入大规模预训练语言模型(例如,530B参数模型),该模型基于每个偏见类别的条件词元概率生成预测。
  • 该方法依赖于模型的内部知识和泛化能力,避免任何微调或参数更新。
  • 该方法在多个二分类和多分类偏见检测任务上,使用人工标注数据集进行了评估。

实验结果

研究问题

  • RQ1使用语义选择样本的少样本指令提示是否能在检测社会偏见方面优于微调模型?
  • RQ2不同提示设计和样本选择策略下,大规模预训练语言模型的性能如何变化?
  • RQ3当标注数据仓库规模大幅缩减时,该方法在多大程度上能保持高性能?
  • RQ4与随机或均匀采样相比,使用类别平衡且语义相关的样本是否能提升检测准确率?
  • RQ5同一提示框架是否能泛化到多种偏见类型,包括粗粒度和细粒度分类?

主要发现

  • 530B参数的大语言模型在大多数偏见检测任务中,AUC指标相比较小模型至少提升了13%。
  • 该方法在极小标注数据下仍保持高性能,当标注数据仓库从35,000个样本减少到100个样本时,AUC下降不足2%。
  • 该少样本提示方法在八项评估任务中的三项上优于微调模型,证明了其更强的泛化能力。
  • 该方法通过成功检测出包括隐性、目标导向和上下文依赖形式在内的广泛社会偏见,展现出鲁棒性和灵活性。
  • 消融研究和定性分析证实,该方法依赖于更深层次的语义理解,而非表层启发式规则或关键词匹配。
  • 该框架能有效处理二分类和多分类偏见分类任务,展现出对多样化偏见定义和目标群体的适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。