[论文解读] Prototypical Calibration for Few-shot Learning of Language Models
本文提出原型校准(ProCa),一种通过使用高斯混合模型(GMM)对模型输出按真实标签聚类,学习稳健且自适应决策边界的少样本文本分类方法。该方法在九个数据集上实现了13%的绝对准确率提升,显著增强了对提示模板、示范顺序和类别不平衡的鲁棒性。
In-context learning of GPT-like models has been recognized as fragile across different hand-crafted templates, and demonstration permutations. In this work, we propose prototypical calibration to adaptively learn a more robust decision boundary for zero- and few-shot classification, instead of greedy decoding. Concretely, our method first adopts Gaussian mixture distribution to estimate the prototypical clusters for all categories. Then we assign each cluster to the corresponding label by solving a weighted bipartite matching problem. Given an example, its prediction is calibrated by the likelihood of prototypical clusters. Experimental results show that prototypical calibration yields a substantial improvement on a diverse set of tasks. Extensive analysis across different scales also indicates that our method calibrates the decision boundary as expected, greatly improving the robustness of GPT to templates, permutations, and class imbalance.
研究动机与目标
- 解决大语言模型少样本学习中因提示和示范变化导致的决策边界脆弱性问题。
- 指出传统贪婪解码(最大概率)在分布偏移下难以有效区分类别。
- 通过建模每类的原型聚类,学习更稳健的决策边界。
- 通过使用学习到的原型分布的似然性而非原始logits对预测进行校准,提升少样本泛化能力。
- 确保在零样本和少样本设置下,对不同提示模板、示范顺序和类别不平衡具有稳定性和鲁棒性。
提出的方法
- 使用高斯混合模型(GMM)将具有相同真实标签的样本预测分布建模为原型聚类。
- 通过加权二分图匹配将每个估计聚类分配给标签,以解决聚类分配中的标签模糊性问题。
- 通过计算每个示例在各类原型分布下的似然性,对测试预测进行校准。
- 采用两种估计策略:最大似然法和分配得分(公式4),以优化聚类-标签对应关系。
- 基于示范的整体输出分布自适应学习决策边界,避免依赖无内容输入。
- 优化决策边界,使其比标准0.5阈值或最大概率规则更具判别性。
实验结果
研究问题
- RQ1为何大语言模型的上下文学习对提示模板和示范顺序高度敏感?
- RQ2能否从模型输出中学习到更稳健的决策边界,以超越贪婪解码提升少样本分类性能?
- RQ3对模型预测进行原型聚类在不同提示格式和类别不平衡下如何提升泛化能力?
- RQ4所提出的校准方法在多大程度上减少了模型归纳偏差和提示工程带来的偏差?
- RQ5为实现可靠原型校准而不发生过拟合,估计集的最优规模是多少?
主要发现
- 在使用GPT-2和GPT-J模型的九个文本分类数据集上,ProCa相比标准贪婪解码平均实现13%的绝对准确率提升。
- 在AGNews和DBPedia数据集上,采用分配得分策略的ProCa将1-shot性能分别提升14.5%和12.0%,甚至超越上下文校准方法。
- 仅需少量估计集(如4–8个样本)即可使ProCa达到接近最优性能,超过一定规模后收益递减。
- 校准后的决策边界显著提升了对提示变化和示范顺序的鲁棒性,大幅降低了不同设置下的性能方差。
- 在SST-2、MR和Subj数据集上,ProCa即使仅使用少量样本,也优于最大似然法和上下文校准基线方法。
- 该方法有效缓解了模型偏差,提升了类别间判别能力,表现为预测分布的清晰分离(图2所示)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。