[论文解读] ALERT: Adapting Language Models to Reasoning Tasks
ALERT 引入了一个全面的基准测试与分析套件,用于评估大语言模型(LLMs)的细粒度推理能力,表明微调——尤其是使用思维链(chain-of-thought)推理过程——能显著提升文本蕴涵、溯因推理和类比推理等推理能力。研究发现,微调使模型的推理能力超越单纯的记忆化,但模型常常过度拟合于提示模板,导致鲁棒性下降。
Current large language models can perform reasonably well on complex tasks that require step-by-step reasoning with few-shot learning. Are these models applying reasoning skills they have learnt during pre-training and reason outside of their training context, or are they simply memorizing their training corpus at finer granularity and have learnt to better understand their context? To tease apart these possibilities, we introduce ALERT, a benchmark and suite of analyses for assessing language models' reasoning ability comparing pre-trained and finetuned models on complex tasks that require reasoning skills to solve. ALERT provides a test bed to asses any language model on fine-grained reasoning skills, which spans over 20 datasets and covers 10 different reasoning skills. We leverage ALERT to further investigate the role of finetuning. With extensive empirical analysis we find that language models learn more reasoning skills such as textual entailment, abductive reasoning, and analogical reasoning during finetuning stage compared to pretraining state. We also find that when language models are finetuned they tend to overfit to the prompt template, which hurts the robustness of models causing generalization problems.
研究动机与目标
- 确定 LLM 是否在微调过程中获得推理能力,还是仅记忆训练数据。
- 评估微调在多大程度上提升了诸如逻辑推理、因果推理和空间推理等特定推理能力。
- 诊断性能提升是源于数据记忆、模板记忆,还是真正的推理能力获取。
- 开发一个基准测试,以实现对多种推理类型和模型变体的细粒度推理能力评估。
- 评估微调模型在分布偏移和提示模板变化下的鲁棒性。
提出的方法
- ALERT 是一个基准测试套件,包含超过 20 个数据集,涵盖 10 种不同的推理能力,包括逻辑推理、因果推理、常识推理、溯因推理、空间推理、类比推理、论据推理、演绎推理、文本蕴涵和数学推理。
- 该框架支持零样本、少样本和思维链(CoT)提示,用于评估任何语言模型在推理任务上的表现。
- 评估了三种模型类型:一个预训练的 OPT 模型、一个在参考答案上微调的 OPT 模型(OPT-FT),以及一个在带有推理过程标注的数据上进行 CoT 微调的 OPT 模型(OPT-CoT)。
- 研究使用词汇重叠分析来衡量微调数据集与评估数据集之间的数据记忆效应。
- 构建了保留数据集,以隔离训练数据中未包含的推理能力,从而评估泛化能力和技能迁移能力。
- 通过改变提示模板来测试鲁棒性,发现模型对特定模板结构存在过拟合现象。
实验结果
研究问题
- RQ1微调后的 LLM 在多大程度上获得了新的推理能力,而非记忆训练样本或提示模板?
- RQ2哪些特定推理能力(例如溯因推理、类比推理、因果推理)在微调后提升最明显?
- RQ3与标准微调相比,CoT 微调是否带来更好的推理表现,是否提升了泛化能力?
- RQ4推理任务中性能提升的多少可归因于数据记忆,多少可归因于实际能力获取?
- RQ5提示模板在多大程度上影响模型行为,对模板的过拟合是否降低了模型的鲁棒性?
主要发现
- 微调在包括文本蕴涵、溯因推理和类比推理在内的多种推理能力上显著提升了性能,表明模型获得了超越记忆化的实际推理能力。
- 使用推理过程进行微调的模型(OPT-CoT)在复杂、多步骤任务上的推理表现优于标准微调模型(OPT-FT)。
- 性能提升的相当一部分并非源于数据记忆,这由保留数据集中微调数据与评估数据之间的词汇重叠率较低所证实。
- 模型对提示模板表现出强烈的过拟合,当模板被更改时性能显著下降,表明其鲁棒性较差。
- 即使是最先进的模型如 text-davinci-003 和 ChatGPT 在某些推理任务上也表现失败,凸显了系统性评估框架(如 ALERT)的必要性。
- 该基准测试揭示,当训练中未出现的推理技能被保留时,模型在这些技能上的泛化能力较差,尤其当这些技能未包含在微调数据中时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。