[论文解读] ORCA: Interpreting Prompted Language Models via Locating Supporting Data Evidence in the Ocean of Pretraining Data
本文提出 ORCA,一种通过迭代梯度选择方法定位支持语言模型在下游任务上性能的预训练数据最小子集的方法。研究发现,BERT 在情感分析和文本蕴涵任务中的零样本性能在很大程度上依赖于 BookCorpus 以及对任务 verbalizer 同义词的掩码示例。
Large pretrained language models have been performing increasingly well in a variety of downstream tasks via prompting. However, it remains unclear from where the model learns the task-specific knowledge, especially in a zero-shot setup. In this work, we want to find evidence of the model's task-specific competence from pretraining and are specifically interested in locating a very small subset of pretraining data that directly supports the model in the task. We call such a subset supporting data evidence and propose a novel method ORCA to effectively identify it, by iteratively using gradient information related to the downstream task. This supporting data evidence offers interesting insights about the prompted language models: in the tasks of sentiment analysis and textual entailment, BERT shows a substantial reliance on BookCorpus, the smaller corpus of BERT's two pretraining corpora, as well as on pretraining examples that mask out synonyms to the task verbalizers.
研究动机与目标
- 识别支持语言模型在下游任务上性能的小型、任务特定的预训练数据子集。
- 提供对提示型语言模型在无微调设置下(尤其是零样本设置)如何学习知识的可解释性。
- 超越输入级别的归因,从全局角度定位影响任务整体行为的预训练数据证据。
- 分析模型在任务能力上是否依赖于特定的预训练数据源或模式。
- 通过检查支撑模型决策的证据,为模型可信度、数据质量和潜在偏见提供洞见。
提出的方法
- 将问题形式化为识别对下游任务性能具有高增量影响的最小预训练样本集合。
- 利用下游任务的任务特定梯度,迭代选择最影响模型预测的预训练样本。
- 应用迭代选择过程,计算每个样本的梯度并选择梯度幅值最高的样本。
- 维护一个支持性数据证据的候选集,并通过多轮梯度引导选择进行优化。
- 使用基于损失的目标来衡量每个预训练样本对模型下游性能影响的程度。
- 在原始预训练数据上操作,无需微调,模拟预训练过程中对特定样本的加权。
实验结果
研究问题
- RQ1哪些特定的预训练样本最直接地支持语言模型在给定下游任务上的零样本性能?
- RQ2模型在情感分析和文本蕴涵等任务中的能力是否源于特定的预训练语料库或模式?
- RQ3与随机子集或嵌入空间中的最近邻相比,支持性数据证据在影响程度和任务相似性方面表现如何?
- RQ4最具影响力的预训练样本中出现了哪些语言模式(例如,同义词掩码)?
- RQ5在无法访问模型微调或重训练的情况下,基于梯度的选择能否有效识别高影响力的预训练数据?
主要发现
- BERT 在情感分析和文本蕴涵任务中的零样本性能在很大程度上由 BookCorpus 支持,尽管它是其两个预训练源中规模较小的一个。
- 模型对那些掩码了任务 verbalizer 同义词的预训练样本表现出强烈依赖,表明其可能记忆了同义词改写模式。
- ORCA 识别出的支持性数据证据在下游任务相似性和影响力方面优于随机子集和嵌入空间中的最近邻。
- MAUVE 相似度得分显示,支持性数据证据的上下文在语义上比基线方法更接近下游任务输入。
- 该方法即使在模型决策无法直接追溯到输入提示时,也能成功识别出高影响力的预训练样本。
- 所发现的证据揭示,模型行为受到预训练数据中特定语言模式(如掩码同义词替换)的影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。