[论文解读] In-Context Learning Learns Label Relationships but Is Not Conventional Learning
本文研究大型语言模型(LLMs)中的上下文学习(ICL),表明 ICL 利用了上下文示例中的标签关系,但其方式与传统学习不同。通过概率度量和受控实验,作者表明 ICL 依赖于上下文中的标签,难以克服预训练偏差,并且不会平等地对待所有上下文信息——揭示了传统学习与非学习行为之间的中间地带。
The predictions of Large Language Models (LLMs) on downstream tasks often improve significantly when including examples of the input--label relationship in the context. However, there is currently no consensus about how this in-context learning (ICL) ability of LLMs works. For example, while Xie et al. (2021) liken ICL to a general-purpose learning algorithm, Min et al. (2022) argue ICL does not even learn label relationships from in-context examples. In this paper, we provide novel insights into how ICL leverages label information, revealing both capabilities and limitations. To ensure we obtain a comprehensive picture of ICL behavior, we study probabilistic aspects of ICL predictions and thoroughly examine the dynamics of ICL as more examples are provided. Our experiments show that ICL predictions almost always depend on in-context labels and that ICL can learn truly novel tasks in-context. However, we also find that ICL struggles to fully overcome prediction preferences acquired from pre-training data and, further, that ICL does not consider all in-context information equally.
研究动机与目标
- 为了理解大型语言模型(LLMs)中的上下文学习(ICL)是否真正从上下文中的标签关系中学习,而非仅仅反映预训练偏差。
- 为了研究当上下文标签与预训练偏好冲突时,ICL 是否能够克服预训练期间获得的预测偏好。
- 为了确定 ICL 是否平等地对待所有上下文信息,尤其是在标签关系不一致或冲突时。
- 为了使用概率度量对 ICL 动态进行全面的实证分析,揭示仅靠准确率无法捕捉到的预测置信度变化。
- 为了解决文献中关于 ICL 是否构成一种传统学习形式的相互矛盾的主张。
提出的方法
- 作者将关于 ICL 行为的关键问题重新表述为统计原假设,并通过受控实验进行实证检验。
- 他们通过随机化上下文标签来评估 ICL 对标签信息的依赖性,使用对数似然作为概率度量。
- 他们引入了一项新颖任务,该任务无任何预训练信号,以测试 ICL 从零开始学习真正新的输入-标签关系的能力。
- 他们系统性地改变上下文样本数量,并使用移动平均和自举置信区间分析预测动态。
- 他们在推理过程中操纵标签关系(例如,在转折点翻转标签),以测试 ICL 是否平等地对待所有上下文信息。
- 他们在多种 NLP 任务(如 SST-2、AG News、RTE 等)上对比多个 LLM(如 LLaMA、Falcon、LLaMA-2)以确保结果的普适性。
实验结果
研究问题
- RQ1ICL 是否依赖于上下文示例的条件标签分布,还是独立于其标签?
- RQ2当上下文标签与预训练偏好冲突时,ICL 是否能够克服预训练偏差?
- RQ3ICL 是否平等地对待所有上下文信息,还是更倾向于使用靠近查询的示例?
- RQ4概率度量(如对数似然)如何揭示仅靠准确率无法捕捉到的 ICL 动态?
- RQ5ICL 在多大程度上以类似于传统学习算法的方式学习标签关系?
主要发现
- ICL 预测显著依赖于上下文标签:在所有任务上,LLaMA-2-70B 的平均对数似然下降高达 -0.995(标签随机化后),证实了其对标签的依赖性。
- ICL 能够从上下文示例中学习新任务,如在无预训练信号的任务上性能提升,证明了其真正的上下文学习能力。
- ICL 无法克服预训练偏差:当上下文标签与预训练偏好冲突时,性能趋于稳定且无法恢复,即使增加提示也无改善。
- ICL 并不平等地对待所有上下文信息:当标签关系被翻转或交替时,预测结果显著依赖于转折点位置,表明其更倾向于使用最新或邻近的示例。
- 概率度量揭示了准确率无法反映的预测置信度的大幅波动,强调了使用基于似然的评估方法对 ICL 分析的重要性。
- LLaMA-2-70B 模型表现出最显著的标签依赖性(对数似然下降 -0.995),而较小的模型(如 LLaMA-7B)虽依赖性较弱,但仍具显著性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。