Skip to main content
QUICK REVIEW

[论文解读] Let's Learn Step by Step: Enhancing In-Context Learning Ability with Curriculum Learning

Yinpeng Liu, Jiawei Liu|arXiv (Cornell University)|Feb 16, 2024
Online and Blended Learning被引用 4
一句话总结

本文提出上下文课程学习(ICCL),一种通过将演示样本按从简单到复杂的顺序排列来提升开源大语言模型少样本上下文学习性能的方法。该方法依赖指令微调以发展出课程感知能力,在科学推理任务上表现显著提升,尤其对较小模型效果更明显;人工设计的排序优于大模型自动生成的排序。

ABSTRACT

Demonstration ordering, which is an important strategy for in-context learning (ICL), can significantly affects the performance of large language models (LLMs). However, most of the current approaches of ordering require high computational costs to introduce the priori knowledge. In this paper, inspired by the human learning process, we propose a simple but effective demonstration ordering method for ICL, named the few-shot In-Context Curriculum Learning (ICCL). The ICCL implies gradually increasing the complexity of prompt demonstrations during the inference process. The difficulty can be assessed by human experts or LLMs-driven metrics, such as perplexity. Then we design extensive experiments to discuss the effectiveness of the ICCL at both corpus-level and instance-level. Moreover, we also investigate the formation mechanism of LLM's ICCL capability. Experimental results demonstrate that ICCL, developed during the instruction-tuning stage, is effective for representative open-source LLMs. To facilitate further research and applications by other scholars, we make the code publicly available.

研究动机与目标

  • 探究是否通过按难度递增顺序组织上下文演示样本,可提升大语言模型在少样本上下文学习中的性能。
  • 确定大语言模型在何时以及如何获得从基于课程的演示排序中受益的能力。
  • 评估人工设计与大模型生成的课程调度在上下文学习中的有效性。
  • 探索在推理阶段直接应用课程学习的可行性,而无需重新训练。

提出的方法

  • 提出上下文课程学习(ICCL),一种将示例按复杂度从低到高排序的演示排序策略,以提升上下文学习效果。
  • 使用人类专家或大模型作为“排序者”,根据感知难度对演示样本进行排序,形成课程调度。
  • 在推理提示中使用有序的演示样本作为上下文,保持模型参数不变,仅改变演示顺序。
  • 在基础模型和指令微调后的模型上,针对科学推理数据集(SciCite、SciNLI)开展实验,比较ICCL与基线上下文学习(ICL)的性能。
  • 设计提示以评估大模型是否能自主生成有效的课程排序,并将其性能与人工精心设计的排序进行比较。
  • 使用F1分数衡量性能,并分析相对于随机排序和标准ICL的性能提升或下降。

实验结果

研究问题

  • RQ1是否通过按难度递增顺序组织上下文演示样本(ICCL)可提升大语言模型在少样本上下文学习中的性能?
  • RQ2模型在预训练阶段还是指令微调阶段获得从基于课程的演示排序中受益的能力?
  • RQ3人工设计的课程调度在ICCL中的表现与大模型生成的课程调度相比如何?
  • RQ4为何ICCL在高性能模型(如GPT-4)上效果有限甚至为负?

主要发现

  • ICCL显著提升了指令微调后的开源大语言模型性能,在Mixtral 8x7B模型上,SciNLI数据集的F1分数平均提升5.62%。
  • 指令微调后的Llama 2 70B模型在使用ICCL时F1分数提升5.62%,而基础模型则下降4.12%,表明ICCL能力在指令微调阶段才出现。
  • 人工设计的课程排序优于大模型自动生成的排序,后者相比随机排序仅平均下降0.29%。
  • ICCL对GPT-4无效,其F1分数平均下降2.56%,表明高性能模型对演示顺序不敏感。
  • 基础模型在使用ICCL时表现不稳定,F1分数相比标准ICL平均下降7.16%,表明在无指令微调的情况下,模型本身不具备对课程排序的敏感性。
  • 本研究证实,人类专家在ICCL中发挥关键作用,其提供的知识丰富、高效的课程能最大化模型参数的利用效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。