[论文解读] On Measuring Social Biases in Prompt-Based Multi-Task Learning
本文研究了输入格式如何影响基于提示的多任务学习中的社会偏见,聚焦于大规模文本到文本语言模型 T0。通过比较语义等价的问答(QA)与前提-假设(NLI)输入形式,作者发现尽管性能相似,T0 在 QA 格式下表现出显著更高的偏见,原因在于训练数据的对齐。他们提出了 BBNLI,这是首个包含人工编写假设的自然语言蕴含偏见基准,并发布代码与数据,以支持未来在多任务模型中减轻偏见的研究。
Large language models trained on a mixture of NLP tasks that are converted into a text-to-text format using prompts, can generalize into novel forms of language and handle novel tasks. A large body of work within prompt engineering attempts to understand the effects of input forms and prompts in achieving superior performance. We consider an alternative measure and inquire whether the way in which an input is encoded affects social biases promoted in outputs. In this paper, we study T0, a large-scale multi-task text-to-text language model trained using prompt-based learning. We consider two different forms of semantically equivalent inputs: question-answer format and premise-hypothesis format. We use an existing bias benchmark for the former BBQ and create the first bias benchmark in natural language inference BBNLI with hand-written hypotheses while also converting each benchmark into the other form. The results on two benchmarks suggest that given two different formulations of essentially the same input, T0 conspicuously acts more biased in question answering form, which is seen during training, compared to premise-hypothesis form which is unlike its training examples. Code and data are released under https://github.com/feyzaakyurek/bbnli.
研究动机与目标
- 探究问题编码形式是否会影响大型语言模型中的社会偏见,且独立于内容因素。
- 比较相同语义输入在问答(QA)与自然语言蕴含(NLI)输入格式下的偏见水平。
- 创建并发布 BBNLI,这是首个针对自然语言蕴含的、包含人工编写假设的偏见基准,以支持对认知与社会偏见的系统性评估。
- 在多任务学习中,将输入形式的影响与内容影响分离,特别是在像 T0 这类在多样化提示上进行训练的模型中。
- 为通过替代性输入格式减轻偏见提供洞见,同时不牺牲模型性能。
提出的方法
- 作者使用 T0,一个经过 62 个数据集和 12 项任务的多样化提示微调的 11B 参数多任务文本到文本模型。
- 他们使用两个基准评估偏见:BBQ(现有的 QA 偏见基准)和 BBNLI(新提出的 NLI 偏见基准,包含针对 16 种有害刻板印象的、来自三个领域的手写假设)。
- BBNLI 中的每个样本均以 QA 和 NLI 两种形式提供,从而在保持语义等价的前提下,实现对模型在不同输入格式下行为的直接比较。
- 作者将现有的 BBQ 样本转换为 NLI 格式(BBQ → NLI),并创建了一个反向基准(BBNLI → QA),以确保在不同输入格式之间实现平衡比较。
- 偏见通过计算模型在典型输出与反刻板印象输出之间偏好程度来衡量,两种格式下均进行测量。
- 所有代码与数据集均已发布于 https://github.com/feyzaakyurek/bbnli,以支持可复现性与进一步研究。
实验结果
研究问题
- RQ1输入形式(如问答与前提-假设)是否会影响多任务语言模型中的社会偏见水平,且独立于内容?
- RQ2在训练中出现过的输入格式(如 QA)与未出现过的格式(如 NLI)之间的偏见水平如何比较?
- RQ3当同一语义输入被重新表述为不同提示模板时,模型行为会如何变化?
- RQ4新的自然语言蕴含基准(BBNLI)能否有效捕捉并测量多任务模型中的认知与社会偏见?
- RQ5通过替代性输入格式是否能降低偏见,同时不损害模型性能?
主要发现
- 尽管语义内容完全相同,T0 在问答(QA)格式下的社会偏见显著高于前提-假设(NLI)格式。
- 偏见差异并非源于性能下降,因为模型在两种输入形式下的准确率保持稳定。
- 模型在 QA 格式下表现出更强偏见,是因为其与训练数据中的模式对齐,表明训练数据分布塑造了模型对偏见的敏感性。
- BBNLI 基准成功捕捉了三个领域中 16 种有害社会刻板印象,包括涉及跳跃逻辑的复杂逻辑结构。
- 本研究证明,输入形式可作为缓解偏见的杠杆:NLI 格式虽未出现在训练数据中,却能有效降低 T0 的偏见。
- BBNLI 及其相关数据集的发布,为未来在多任务学习与零样本泛化设置下研究偏见提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。